Обновить
128K+

Natural Language Processing *

Компьютерный анализ и синтез естественных языков

172,41
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Gemini 3.7 Flash: это снова не та модель, которую все ждали

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели7.9K

Наверняка вы уже видели заголовок «Google выпустила новую Gemini» примерно миллион раз за последний год.

13 августа 2026 года это случилось снова: на сцену вышла Gemini 3.7 Flash.

Pro-модели снова нет. Опять Flash. Третий Flash за три месяца, если быть точным.

Расскажу, что изменилось. Заодно разберём пользовательские тесты и бенчмарки.

Читать далее

Новости

ИИ‑агент внутри КОМПАС-3D: пишет код, строит деталь и проверяет результат

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели39K

Я сделал ИИ‑агента для КОМПАС-3D: он живёт прямо в окне программы, принимает запрос текстом или фотографией и строит параметрическую деталь — не мёртвую геометрию в step, а дерево построения с переменными, которое пригодно для редактирования.
Агент пишет код и сам смотрит на то, что построил, — анализирует рендеры «глазами» через VLM.
В статье: как хорошо агент справляется с моделированием по тексту и чертежам уже сейчас, почему один блок кода лучше десяти tool'ов и почему агенту мало просто «видеть» результат.

Читать далее

Лучше проще. Как переупаковать базу знаний в сервис персонализированной помощи

Время на прочтение8 мин
Охват и читатели5.5K

Салют, Хабр!

Я Антон, продакт сервисов клиентской документации. Одна из задач нашей команды — решать проблемы пользователя как можно проще: без долгих диалогов с чат-ботом или техподдержкой, где приходится излагать, что случилось, как и когда; без поисковиков в надежде, что где-то на форумах найдётся ответ. Поэтому мы запустили на интеллектуальных телевизорах и медиацентрах Сбер сервис персонализированной контекстной помощи — ГигаСправку. Теперь, если устройство выдаёт ошибку, вместе с ней на экране появляется кнопка ГигаСправки. Нажав на неё, пользователь получает совет, как можно исправить проблему с учётом конкретного устройства и его состояния.

Эффект от нового сервиса для техподдержки огромен, а техническая реализация проста: всего одна точка знаний, RAG-сервис, ГигаЧат и семантическое кэширование позволяют предельно быстро помогать юзеру на той же поверхности. Показывать то, что нужно, там, где нужно. Рассказываем, как превратили базу с ответами на вопросы в ГигаСправку.

Читать далее

476 000 новостей против нейронки: пять попыток заставить текст предсказывать цену

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.1K

Гипотеза «новости двигают рынок» — самая интуитивная в трейдинге. Настолько интуитивная, что я потратил на её проверку недели GPU-часов, полный архив финансовых телеграм-каналов с 2021 года и пять принципиально разных постановок задачи — от простых счётчиков упоминаний до NLP-разметки и пер-минутного event study.

Результат: ноль из пяти. Ни одна постановка не улучшила боевую модель (с одной унизительной для NLP оговоркой — она в конце).

Но интересен не сам ноль — интересно, как именно проваливалась каждая попытка. Две из пяти сначала показали «улучшение» в бэктесте, и если бы я остановился на агрегатной цифре, сейчас бы искренне рассказывал вам, что нейронка с новостями торгует лучше. Эта статья — подробный разбор всех пяти механизмов: что строил, какие признаки считал, какие цифры получил и где именно каждая версия обманывала.

Это обещанное продолжение статьи про сидовый шум ±10 п.п. — протокол проверки оттуда, здесь он работает на живом сквозном примере.

Читать далее

Квантизация LLM: как запихнуть 70B модель в свою видюху

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.5K

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.

Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

Материал будет полезен как мимо проходящим ИИ-любопытствующим, так и ML-инженерам и специалистам по инференсу LLM, которые хотят запускать большие модели на ограниченном железе. Покажу, как все это гонять на практике и с кодом.

Читать далее

Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели5.8K

Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски?

Мы решили проверить — и быстро выяснили, что ответ сложнее, чем кажется. Штатная система понимала только китайский, Whisper ошибался на коротких командах, LLM добавляла задержку, а динамик съедал начало фразы после паузы. «Беги» превращалось в «begin», а «встань» — в «Таня».

Рассказываем, как нам удалось построить свой собственный модульный русскоязычный стек, разделить команды и диалог, ускорить синтез речи, и добиться реакции за доли секунды. С архитектурой, тестами и новыми нерешёнными задачами. Полный гайд как заставить робота ростом 173 см и весом 75 кг слушать вас и понимать!

Читать гайд

Кронекером по Фишеру: как при сжатии LLM учесть кривизну второго порядка и не умереть

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели7.4K

Привет Хабр! На связи Вика Чекалина из команды «Мультимодальный ИИ» AIRI. Сегодня мы поговорим о том, как выкручиваться, когда вычислительных ресурсов мало и для деплоя необходимо сжать LLM, но так, чтобы потеря в качестве была минимальной. Логично, что нужно использовать дополнительную информацию — например, матрицу Фишера (FIM), которая содержит в себе информацию о важности и взаимодействии параметров модели. 

Но FIM реальных LLM слоев просто огромные, и работать с ними напрямую вычислительно тяжело или просто невозможно. Люди придумывают различные упрощения: например, можно отталкиваться от предположения, что матрица Фишера диагональна — это сильно сокращает объём памяти, однако корреляция между различными параметрами слоя теряется навсегда. Мы решили не идти на такие компромиссы и придумали метод, который быстро и легко позволяет параметризировать полную недиагональную матрицу Фишера без потери информации о корреляции.

Читать далее

Нужную книгу больше не обязательно искать: как ИИ меняет сам принцип работы с информацией

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели14K

Что, если нужную книгу больше не нужно искать — её можно собрать под собственный вопрос?

Я проверил эту идею на реальном корпусе: 206 длинных видео, 160 часов 56 минут и 2,15 млн слов транскриптов.

Вместо сотен summary я построил конвейер, который выделяет сущности, схлопывает дубли, отслеживает происхождение выводов, проверяет важные утверждения и понимает, когда оставшиеся источники уже не нужно читать подряд.

По ходу выяснилось, почему 9 URL могут оказаться одним источником, почему векторная кластеризация не решила задачу смысловых дублей, чем такой подход отличается от RAG и почему длинная работа ИИ-агента неожиданно начинает напоминать разработку обычной программной системы.

Но главный вывод оказался шире самого проекта: единицей работы с информацией может становиться не источник, а наш вопрос.

Читать далее

Бесплатные API к Claude, GPT, DeepSeek и другим моделям: 6 AI-роутеров с бесплатным доступом

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели98K

Собрал 6 AI-роутеров с бесплатным доступом к Claude, GPT, DeepSeek, Qwen и другим моделям. Показываю, что реально дают после регистрации: баланс, доступные модели, лимиты и нюансы работы через API.

Читать далее

Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.6K

В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос: ломает ли квантизация уже существующий retrieval.

Но у такого замера есть неприятное слепое пятно. Можно аккуратно сохранить 99% выдачи исходного эмбеддера и все равно плохо находить нужные документы на своем домене. Внешний бенчмарк, даже сильный, этого не гарантирует. BEIR как раз был создан, чтобы показать, насколько результаты retrieval меняются между разными задачами и доменами; один усредненный скор там не заменяет проверку на собственных данных.

Нужен свой eval set. И тут обычно возникает ложная развилка:

Читать далее

Перевод книги целиком: как я создал конвейер с помощью LLM

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели16K

Я потратил пару недель на создание конвейера с открытым исходным кодом, который переводит книги целиком с помощью платных подписок на LLM. Поддерживаются Claude Code, Antigravity CLI и Codex. В статье описаны принципы построения конвейера для максимального качества перевода, а также тонкости по лимитам, скорости, цензуре и т.п. Проект BookTrans на GitHub.

Читать далее

Single Task Algorithmic Reasoning Models: как с помощью маленькой модели обойти большую LLM?

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели14K

Привет, Хабр! Результаты коллег по цеху и наши исследования позволяют сделать однозначный вывод: в 2026-м для рецепта отличной reasoning-модели уже недостаточно лишь текстовых рассуждений. Для качественных ответов на большинство вопросов пользователей нужна работа с инструментами, мультимодальные режимы рассуждений, и нередко даже такая экзотика, как рассуждения в латентных представлениях сети.

Мы рады поделиться с сообществом фреймворком для обучения рекурсивных reasoning-моделей STARM, существенно опережающих по качеству предыдущие open source-аналоги.

Читать далее

Как работают текстовые ИИ-вотермарки и как их обходить

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели8.2K

Наверное уже многие знают, что в силу недавно вступивших в ЕС законов, регулирующих использование ИИ, провайдеры LLM обязаны помечать ИИ-сгенерированные тексты. Та же Claude недавно обновила справочную информацию о работе своей помечалки сгенерированного ИИ контента, в том числе и текста. Но в подробности его работы почему-то вдаваться не стала, как и размещать в публичном доступе средства добавления и обнаружения этих самых вотермарок.

Не то чтобы я часто балуюсь текстовым нейрослопом, но сама идея того, что твой текст могут им объявить чисто случайно или в следствии того, что ты отредактировал иишкой его часть, меня не сильно радует. Поэтому в этой статье мы разберемся, как собственно эти метки работают, и как с ними бороться.

Читать далее

Ближайшие события

Как собрать персональную wiki без Claude Code

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели5.7K

Идея Andrej Karpathy с LLM-wiki набирает сторонников. На Хабре уже было несколько публикаций (1, 2, 3), в том числе и моя про сравнение LLM-wiki и RAG-системы. Ещё больше статей я нашёл на medium.

У вас есть Claude Code? Собрать персональную википедию можно менее чем за час. А что делать, если Claude Code и ему подобные инструменты по разным причинам недоступны? Можно ли алгоритмизировать процесс и использовать «слабые» модели? На сколько получившаяся структура будет хуже и как их сравнивать? В статье попробую ответить на эти вопросы, а также расскажу как построить персональную wiki на Ollama или GPT-моделях.

Читать далее

«Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели5.3K

Дано: стихотворение. Тема — «тщетность накопления жизненного опыта», амфибрахий, четыре строки. Заканчивается словом «тосок». Такого слова в русском языке нет. Мой оценщик поставил этому тексту техничность 1.000 — идеал.

К этому моменту я месяц жёг GPU-часы на арендной L40S, пытаясь заставить Gemma 4 писать русские стихи. У меня был план из четырёх пунктов, свежая статья с рабочим рецептом, размеченный корпус на 13 тысяч пар и собственная метрика, проверенная на Пушкине. План развалился весь, но каждый раз не в том месте, где я ждал: главный подозреваемый до последнего выглядел очевидным, а виновным оказался совсем другой персонаж.

Это детектив про то, как четыре файнтюна подряд проиграли необученной базе, как я месяц принимал решения по шуму и не знал об этом — и почему рифму нельзя выучить в принципе, а можно только навязывать.

Настоящие цифры, реальный loss и плохие стихи прилагаются.

Читать далее

Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход

Время на прочтение8 мин
Охват и читатели7.4K

Один пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный.

Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже.

А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте.

Разобраться с токенами

Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели10K

На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA.

Почему инференс LLM дорогой и какие оптимизации помогают его ускорять: fused kernels, FlashAttention, KV-cache и PagedAttention, continuous batching, speculative decoding, квантизация и дистилляция.

Много схем и картинок, а также полный список вопросов с собесов в конце.

Читать далее

Один запрос, семь ИИ-поисковиков, ноль общих источников

Время на прочтение6 мин
Охват и читатели11K

Когда человек спрашивает у ассистента «к кому обратиться», он получает не десять синих ссылок, а один ответ с пятью-десятью доменами внутри. Я прогнал два запроса через семь ИИ-поисковиков в один заход и сравнил, кого именно они цитируют. Общего источника не нашлось ни одного, а три модели разных разработчиков выдали дословно совпадающие списки — потому что веб-поиск им делает один и тот же плагин. Ниже — стенд, цифры и пять мест, где методика такого замера ломается.

Читать далее

Диффузионные языковые модели: как устроены, что в них работает, а что вызывает вопросы

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели8K

Привет, Хабр. На связи команды «Интерпретируемый ИИ» и «Основы генеративного ИИ» AIRI и «Генеративная поэзия» SberAI. Мы занимаемся альтернативными архитектурами языковых моделей — тем, что могло бы работать вместо привычной генерации токен за токеном слева направо.

Одно из таких направлений — диффузионные языковые модели (dLLM). Диффузионные языковые модели, в отличие от обычных LLM, генерируют текст параллельно, несколько токенов за раз. Теоретически это даёт кратное ускорение. Также они не ограничены генерацией справа от контекста и могут заполнять произвольные пропуски в поданном на вход тексте.

Мы много работали с dLLM, перепробовали кучу моделей, набив на них шишек, и даже предложили свои. В результате накопилось большое понимания того, какие подходы действительно работают, а какие вызывают много вопросов касательно их воспроизводимости. Обо всём об этом рассказываем в обзоре ниже.

Читать далее

Почему голосовые ИИ‑агенты перебивают людей: замерил на боевом API и починил правилами русского синтаксиса

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7.3K

Все голосовые платформы решают, что человек договорил, по таймеру тишины. Я замерил, во что это выливается на живой русской речи, и получил цифру, которая меня удивила: из 1275 мс задержки перед ответом 1200 мс — это ожидание секундомера, и только 75 мс — работа самой модели.

Ниже — методика, замеры и решение, которое даёт 316 мс вместо 1200 при двух обрывах вместо тридцати восьми. Всё воспроизводимо, детектор — на правилах, без обучения и без GPU.

Читать далее
1
23 ...