Нейросети5 мин чтения

За несколько дней Anthropic, OpenAI, xAI и Meta* показали новые модели

Кратко: Со стороны это выглядит как выставка достижений: каждая компания принесла график, на котором её модель умнее, быстрее или дешевле остальных. Статья на Хабре хорошо собирает релизы в одну картину, но таблицы бенчмарков скрывают более интересные изменения.

Со стороны это выглядит как выставка достижений: каждая компания принесла график, на котором её модель умнее, быстрее или дешевле остальных. Статья на Хабре хорошо собирает релизы в одну картину, но таблицы бенчмарков скрывают более интересные изменения.

Почти все современные языковые модели построены на одной основе, которая называется Transformer. При этом компании по-разному собирают модели поверх этой основы. Одни модели используют все свои параметры для каждого ответа, другие подключают только нужные части. Также различаются способы работы с длинными текстами, изображениями, звуком и связями между словами. Общий принцип у моделей похожий, а внутренняя реализация и обучение заметно отличаются.

Ещё сильнее отличается обучение. Предварительное обучение формирует базовые знания модели. Затем идут дообучение на инструкциях, человеческая обратная связь, обучение с подкреплением, синтетические задачи, проверяемые среды и агентные симуляции. Исследования InstructGPT показали, что модель на 1,3 миллиарда параметров после качественного дообучения могла получать более высокие человеческие оценки, чем базовая GPT-3 на 175 миллиардов параметров. DeepSeek-R1 показал, что масштабное обучение с подкреплением способно развивать сложное рассуждение поверх уже существующей базовой модели.

Поэтому современный релиз моделей стоит рассматривать сразу на нескольких уровнях: архитектура базовой модели, метод обучения, объём вычислений во время ответа, работа с инструментами, память, система агентов и ограничения доступа.

У GPT-5.6 главная новизна связана с переходом от генерации ответа к организации исполнения.

Модель получила Programmatic Tool Calling. Она может написать небольшую программу, через неё управлять инструментами, обработать промежуточные результаты и передать дальше только важные данные. Раньше агент часто работал по схеме: вызвать инструмент, получить огромный ответ, перечитать его целиком, выбрать следующий шаг. Теперь часть этой работы переносится в исполняемый код. Это снижает количество обращений к модели и расход токенов.

Режим ultra развивает ту же идею. GPT-5.6 распределяет задачу между четырьмя агентами, запускает направления параллельно и собирает результат. Перед нами уже система управления командой моделей. Sol, Terra и Luna скорее задают разные уровни стоимости и доступной вычислительной мощности внутри этой системы. Точная архитектура семейства в открытых материалах OpenAI остаётся закрытой.

Самый интересный релиз OpenAI с точки зрения архитектуры взаимодействия, GPT Live.

Предыдущие голосовые системы либо последовательно запускали распознавание речи, языковую модель и синтез голоса, либо ждали завершения реплики пользователя. GPT Live использует full-duplex архитектуру: модель продолжает слушать во время собственного ответа и несколько раз в секунду решает, говорить, молчать, перебить, вызвать инструмент или дождаться продолжения фразы.

Дополнительно OpenAI разделила разговор и сложную работу. GPT Live поддерживает живой диалог, а поиск и глубокое рассуждение передаёт другой модели. Пользователь продолжает общение, пока отдельный агент выполняет задачу. Здесь появился новый принцип интерфейса: быстрый собеседник управляет более медленными интеллектуальными процессами. Это уже заметный отход от привычного чата с последовательными сообщениями.

Anthropic показала другой тип инновации. Claude Fable 5 и Mythos 5 используют одну базовую модель. Разница создаётся системой доступа и защитными классификаторами.

Fable предназначена для широкой аудитории. При обнаружении чувствительного запроса отдельные модели-классификаторы передают задачу Claude Opus 4.8. Mythos открывает больше возможностей для проверенных специалистов по информационной безопасности и биологии. Одна и та же модель получает разные границы применения в зависимости от пользователя и сценария.

Инновация Anthropic лежит в управлении возможностями. Раньше безопасность чаще выглядела как отказ внутри ответа. Теперь она становится отдельным маршрутизирующим слоем: система оценивает запрос, выбирает разрешённый уровень модели и сохраняет полезный ответ через переключение на более безопасный вариант.

Muse Spark 1.1 от Meta (экстремисткая и неприятная) развивает модели в сторону персональных агентов.

Модель обучали управлять несколькими исполнителями, делить задачу на параллельные направления и работать как главным агентом, так и подчинённым. Она самостоятельно сжимает контекст объёмом до миллиона токенов, сохраняя решения и детали, которые пригодятся позднее.

Особенно интересен подход к управлению компьютером. Muse Spark выбирает между действиями в интерфейсе и автоматизацией через скрипт. Простое действие выполняется кликом, длинная последовательность превращается в программу, несколько операций объединяются в пакет. Фактически Meta (экстремисткая и неприятная) обучает модель выбирать способ воздействия на среду, а не правильный следующий шаг.

Grok 4.5 выглядит как сильная инженерная эволюция обучения.

xAI тщательно отбирает данные для обучения, отдельно готовит задачи по программированию и учит модель на результатах её собственных действий. Агент может выполнять сложную задачу несколько часов, а система в это время собирает промежуточные результаты и продолжает улучшать модель с помощью десятков тысяч вычислительных ускорителей.

Публичное описание Grok 4.5 делает акцент на данных, инфраструктуре и длительных RL-прогонах. Новая архитектурная идея в релизе публично не заявлена. Его вклад связан с промышленным масштабированием обучения агентов: больше проверяемых задач, длиннее траектории, быстрее обратная связь.

GLM-5.2 делает ставку на рабочий длинный контекст.

Модель поддерживает контекст до миллиона токенов и вывод до 128 тысяч токенов. Разработчики позиционируют её для работы со всем проектом: требованиями, структурой репозитория, контрактами API и историей решений.

Сам по себе миллион токенов уже встречается у нескольких компаний. Ценность GLM-5.2 будет определяться устойчивостью на длинной дистанции: сохранением ограничений проекта, поиском нужной детали и завершением работы после десятков вызовов инструментов. Здесь инновация измеряется качеством памяти и выполнения, а не размером заявленного окна.

Общая картина релизов показывает новый этап развития индустрии. Компании продолжают улучшать Transformer, данные и обучение, но основная конкуренция постепенно переходит на уровень всей системы.

Модель превращается в один компонент стека. Рядом появляются маршрутизаторы, память, классификаторы безопасности, программы для управления инструментами, компьютерное зрение, голосовой интерфейс и команды субагентов.

Самым новым принципом взаимодействия среди этих релизов выглядит GPT Live. Самое заметное развитие агентной системы показывает GPT-5.6 с программным вызовом инструментов и режимом ultra. Anthropic сильнее остальных изменила модель управления доступом к опасным возможностям. Muse Spark 1.1 интересна обучением модели выбирать между кликами, скриптами и делегированием. Grok 4.5 масштабирует фабрику обучения агентов. GLM-5.2 пытается сделать длинный контекст пригодным для полноценной работы над проектами.

Формулировка «самая умная модель» постепенно теряет практическую ценность. Гораздо важнее, сколько реальной работы система завершает самостоятельно, сколько раз просит человека вмешаться, умеет ли обнаруживать собственные ошибки, сохраняет ли контекст и выбирает ли подходящий инструмент.

Следующий крупный скачок может появиться без полного отказа от Transformer. Достаточно собрать вокруг знакомого ядра систему, которая видит, помнит, планирует, распределяет работу и проверяет результат. Именно эту систему сейчас по частям показывают новые релизы.

Вопросы по материалу

О чем этот материал?

Со стороны это выглядит как выставка достижений: каждая компания принесла график, на котором её модель умнее, быстрее или дешевле остальных. Статья на Хабре хорошо собирает релизы в одну картину, но таблицы бенчмарков скрывают более интересные изменения.

Кто автор материала?

Материал подготовил Игорь Колосов. Автор материалов о продуктивности, IT, управлении, нейросетях и инструментах для работы и жизни.

Когда материал опубликован или обновлен?

Дата публикации: 11.07.2026. Последнее обновление: 11.07.2026.