Анонсирована модель для сложной работы, кода и управления компьютером. Доступ расширяется поэтапно.
Хроника
Каждое датированное событие на линии, от свежего к старому. Фильтр — по ветви и вехе.
От GPT и BERT до современных текстовых, мультимодальных, графических, видео- и аудиомоделей. Здесь учитываются публичные релизы и значимые research preview; ссылка ведёт на первичный блог, документацию или публикацию команды.
GA-релиз Flash для программирования, агентов и сложных рабочих процессов; текстовый вывод и мультимодальный ввод.
Meta обновила модель для длительной агентной работы и программирования. Доступна в Muse Code и Meta Model API.
Обновление для кода и длительных проектов в платных продуктах Claude и API. При чтении тестов учитывайте safeguards и fallback.
Z.ai выпустила post-training обновление базы GLM-5.2 с крупным приростом в сложном программировании, терминальных задачах и длительной агентной работе.
Google выпустила GA-версию быстрой reasoning-модели с миллионным контекстом и улучшениями для программирования, веб-разработки и агентных процессов.
Финальный checkpoint V4-Pro заменил preview-версию, заметно усилил агентные задачи и вышел с открытыми весами под лицензией MIT.
Grok 4.6 усилил длительные агентные задачи, программирование и создание интерактивных продуктов; модель вышла в Cursor, Grok Build, API и у партнёров.
Meta выпустила под Apache 2.0 локальную 30B agentic-модель с восприятием изображений, инструментами, восстановлением после ошибок и официальными GGUF-сборками.
Meta обновила проприетарную coding- и agentic-модель Muse Spark: версия 1.2 усилила многофайловую разработку, использование компьютера и длительные рабочие процессы.
Moonshot AI опубликовала веса Kimi K3 вместе с инструкциями для Transformers, vLLM и SGLang. Это open-weights релиз для серверной инфраструктуры: масштаб 2,8T параметров не подразумевает обычный локальный запуск.
Black Forest Labs открыла Early Access к мультимодальной основе для изображений, видео, аудио и action prediction; отдельные возможности запускаются поэтапно.
Флагман OpenAI усилил агентные задачи в программировании, биологии и кибербезопасности.
Модель с миллионным контекстом сделала упор на более дешёвое вычисление и ускоренные prefill и decoding.
Компактная reasoning-модель стала резервным быстрым вариантом GPT-5.4 Thinking в ChatGPT.
Специализированная агентная модель объединила обучение Codex и GPT-5 для длинных задач программирования.
Обновление улучшило согласованность персонажей и объектов, вертикальное видео и вывод до 4K.
OpenAI объединила быстрый ответ, глубокое рассуждение и маршрутизацию между режимами в одной продуктовой системе.
20B MMDiT-модель сделала особый упор на сложную типографику и точное редактирование текста внутри изображений.
Opus 4 и Sonnet 4 усилили длительное программирование, использование инструментов и агентные сценарии.
Видеомодель получила нативную генерацию звука, речи и фоновых шумов вместе с изображением.
Новое поколение генерации изображений улучшило детализацию, типографику и скорость.
Google расширила доступ к музыкальной модели и встроила её в инструменты для авторов.
Открытое семейство объединило обычный и thinking-режимы и включило плотные и MoE-модели разных размеров.
Reasoning-модели впервые начали совместно рассуждать по изображениям и пользоваться полным набором инструментов ChatGPT.
Нативно мультимодальное MoE-семейство Scout и Maverick расширило контекст и работу с изображениями.
Thinking-модель Google объединила рассуждение, код и мультимодальное понимание с длинным контекстом.
Крупнейшая на тот момент модель OpenAI для чата стала исследовательским превью масштабирования предобучения без отдельного reasoning-режима.
Anthropic объединила быстрые ответы и видимое расширенное рассуждение в одной модели.
Vision-language семейство научилось разбирать документы, интерфейсы, диаграммы и длинные видеопоследовательности.
Открытая reasoning-модель и её дистилляты показали, что усиленное обучение может конкурировать с закрытыми системами рассуждения.
Открытая MoE-модель с 671B общих и 37B активных параметров резко снизила стоимость сильной языковой модели.
Google сделала упор на нативную работу с инструментами, потоковое мультимодальное взаимодействие и будущих агентов.
Sora вышла из исследовательского превью в отдельный продукт с генерацией и редактированием роликов.
В семейство вошли vision-модели 11B/90B и компактные текстовые 1B/3B для локальных устройств.
Семейство открытых моделей от 0.5B до 72B расширило многоязычность, код, математику и структурированный вывод.
Модель получила отдельное вычисление перед ответом и заметно улучшила математику, код и сложное рассуждение.
Новое семейство генераторов изображений объединило открытую модель Schnell и более мощные коммерческие версии.
Meta выпустила 405B-модель с 128K контекста и разрешила использовать её выводы для улучшения других моделей.
Средняя по размеру модель обошла прежний Opus во многих задачах и усилила работу с кодом и изображениями.
Google представила генератор 1080p-видео с кинематографическими стилями и более длинными сценами.
Новое поколение Imagen улучшило фотореализм, детали и уменьшило количество визуальных артефактов.
Единая модель начала принимать и генерировать текст, зрение и речь с низкой задержкой.
Открытые 8B и 70B модели подняли качество диалога, рассуждений и программирования.
Семейство Haiku, Sonnet и Opus добавило зрение и разделило модели по скорости, цене и максимальному качеству.
Новая MMDiT-архитектура улучшила текст в изображениях и следование сложным запросам.
Модель получила контекст до миллиона токенов и могла совместно анализировать длинные документы, код, аудио и видео.
OpenAI показала генерацию длинных видеосцен как задачу моделирования динамики визуального мира.
Открытая смесь экспертов активировала лишь часть параметров на каждом токене и сделала крупную модель дешевле в работе.
Google представила семейство, изначально обученное работать с текстом, изображениями, аудио и видео.
Открытая research-preview модель перенесла диффузионную генерацию из изображений в короткое видео.
Компактная открытая модель показала, что архитектура и качество данных могут конкурировать с более крупными моделями.
Генератор изображений встроили в ChatGPT: модель стала точнее понимать сложные текстовые инструкции.
Открытые веса стали доступны для исследований и большинства коммерческих сценариев.
Claude получил 100K контекста, более сильное программирование и широкую публичную доступность.
Первая публичная версия Claude предложила длинные ответы и отдельный подход к обучению безопасному поведению.
Флагман OpenAI получил ввод изображений, более сильное рассуждение и заметно более устойчивое следование инструкциям.
Meta выпустила исследовательское семейство от 7B до 65B и усилила движение к доступным весам моделей.
Диалоговый интерфейс и обучение по человеческой обратной связи сделали большие языковые модели массовым продуктом.
Открытая модель распознавания речи объединила много языков, перевод и устойчивость к шуму.
Открытая модель перенесла качественную генерацию изображений на пользовательские GPU и породила большую экосистему дообучений.
Крупный текстовый энкодер и каскад диффузионных моделей заметно улучшили соответствие изображения запросу.
Одна visual-language модель научилась решать много задач по нескольким примерам из текста и изображений.
Диффузионная генерация повысила разрешение, реализм и управляемость редактирования изображений.
Модель, обученная на коде, превратила естественный язык в программные конструкции и стала основой первого GitHub Copilot.
Текстовая команда впервые управляла генерацией изображений через крупную модель семейства GPT.
Совместное пространство текста и изображений позволило распознавать новые визуальные категории без отдельного обучения.
175 млрд параметров сделали обучение по примерам в промпте заметной способностью большой языковой модели.
Google свела разные языковые задачи к единому формату «текст на входе — текст на выходе».
Масштабирование языковой модели дало связный длинный текст и первые убедительные zero-shot-переносы между задачами.
Двунаправленное предобучение сделало контекст слова доступным сразу слева и справа и изменило поиск, классификацию и извлечение ответов.
Первая модель семейства GPT показала, что один предобученный Transformer можно адаптировать к нескольким языковым задачам.