🚀 Наш Telegram-канал про AI-агентов: новости, фишки и лайфхаки автоматизации Подписаться
Новость

Kimi K3 — первая в мире модель класса 3T с открытыми весами — и она почти здесь

21 июля 2026 Автор — ИИ-команда OfficeForge · проверено командой 5 мин чтения
Kimi K3: Первая открытая модель класса 3T появляется для AI-команд

Moonshot AI официально представила Kimi K3, модель с 2.8 трлн параметров, которая претендует на звание первой в мире открытой модели класса 3T. Анонс, освещённый в официальном блоге Kimi K3, знаменует значимый сдвиг для команд, создающих AI-пайплайны на собственной инфраструктуре: модель, приближающаяся к передовому уровню рассуждений — с открытыми весами, которые появятся к 27 июля 2026 года.

На сегодня модель доступна на Kimi.com, Kimi Work, Kimi Code и в Kimi API. Но ключевое событие для самостоятельно размещённых команд — это скорый выпуск с открытыми весами. Впервые модель такого класса параметров можно будет скачать и запустить за пределами облака одного вендора.

Что из себя представляет Kimi K3

Kimi K3 построена на двух архитектурных инновациях: Kimi Delta Attention (KDA) и Attention Residuals (AttnRes), разработанных для улучшения потока информации как по длине последовательности, так и по глубине модели — что критически важно для работы с окном контекста в 1 млн токенов.

Модель использует архитектуру Mixture of Experts (MoE) со значительной разреженностью: при каждом прямом проходе активируется только 16 из 896 экспертов в сочетании с тем, что Moonshot называет фреймворком Stable LatentMoE. Эта стратегия разреженной активации делает модель с 2.8 трлн параметров практичной для запуска — большинство параметров остаются бездействующими в ходе любого конкретного вызова инференса.

Определение

Mixture of Experts (MoE): Архитектура, в которой модель содержит множество подсетей («экспертов»), но только подмножество из них активируется для каждого входа. Это позволяет удерживать стоимость инференса близкой к стоимости для гораздо меньшей плотной модели, сохраняя при этом ёмкость знаний полного количества параметров.

В сочетании с улучшенными рецептами обучения и данных эти структурные изменения дают то, что Moonshot описывает как примерно 2.5-кратное улучшение общей эффективности масштабирования по сравнению с предыдущей моделью Kimi K2 — то есть тот же бюджет вычислений даёт значительно бо́льшие возможности.

Модель поставляется с нативными возможностями зрения и по умолчанию запускается с максимальным усилием мышления; настраиваемые режимы с низким и высоким усилием запланированы на более поздние обновления.

Производительность: вблизи передового рубежа

В наборе оценок Moonshot модель Kimi K3 стабильно превосходила все другие протестированные модели — за двумя исключениями. Она всё ещё уступает Claude Fable 5 и GPT 5.6 Sol по общему качеству. Но разрыв достаточно узок, чтобы для многих практических задач разница могла не иметь значения — особенно когда команды смогут запускать K3 на собственном железе без посимвольной оплаты API.

Полные детали бенчмарков обещаны вместе с техническим отчётом в момент выпуска весов. Что Moonshot опубликовала сейчас — это детальные оценки по программированию, и они наиболее показательны.

Программирование: самый сильный сигнал

Самые убедительные демонстрации Kimi K3 связаны с инженерными задачами на длинном горизонте — именно тот вид работы, за который автономные AI-агенты и ценятся.

Оптимизация ядер

Moonshot протестировала способность модели оптимизировать ядра GPU по четырём задачам, охватывающим AttnRes, KDA и ядро MLA с размерностью 512 голов. Каждая модель работала независимо в идентичной песочнице, име до 24 часов на профилирование, перезапуск и бенчмаркинг на NVIDIA H200 и GPU оборудования от альтернативного вендора.

Результаты: Kimi K3 продемонстрировала конкурентоспособные результаты с Claude Fable 5 — с оговоркой, что результаты Fable 5 могут включать поведение отката и оценивались третьей стороной. Она существенно превзошла Opus 4.8, GPT 5.6 Sol и GPT 5.5. Примечательно, что на поздних этапах разработки ранняя версия Kimi K3 взяла на себя большую часть работы команды Kimi по оптимизации собственных ядер — модель «ест свою собственную еду».

Создание компилятора с нуля

В более амбициозном тесте Kimi K3 создала MiniTriton — компактный компилятор, похожий на Triton, с нуля, включая собственный IR-уровень поверх MLIR, проходы оптимизации и пайплайн генерации PTX-кода. Это не патчинг существующего кода; это построение целого инструментария компиляции.

MiniTriton демонстрирует производительность на уровне или выше, чем Triton и torch.compile на поддерживаемых бенчмарках, и превосходит Triton на некоторых задачах. Также он поддерживает сквозное обучение nanoGPT со стабильной сходимостью, кривая потерь closely следует за эталоном — валидация полного пайплайна на реалистичной задаче.

Визуальная разработка и проектирование чипов

Kimi K3 объединяет 3D-рассуждения, кодирование и зрение, чтобы превращать концепции и изображения в интерактивные опытные образцы, итерируя между кодом и живыми скриншотами в рабочем процессе «зрение в цикле».

Пожалуй, самая поразительная демонстрация: в рамках одного 48-часового автономного запуска Kimi K3 спроектировала, оптимизировала и верифицировала чип с использованием инструментов EDA с открытым исходным кодом на библиотеке Nangate 45nm. Получившийся чип площадью 4 мм² закрывает тайминг на 100 МГц и поддерживает пропускную способность декодирования свыше 8700 токен/с в симуляции, вмещая 1.46 млн стандартных ячеек, 0.277 МБ SRAM и массив INT4 MAC со слитой деквантизацией. Чип, построенный моделью — для модели — конкретная демонстрация возможности агента на длинном горизонте.

Ускорение исследований

В вычислительной астрофизике Kimi K3 автономно проверила и перекрёстно валидировала более 20 статей, а затем реализовала полный числовой пайплайн для воспроизведения универсальных соотношений I–Love–Q. По словам Moonshot, задача была выполнена примерно за два часа — работа, которая обычно занимает одну-две недели у опытного исследователя.

Что это значит для самостоятельно размещённых команд

Значимость для команд, работающих на самостоятельно размещённом AI, — это не просто «более крупная модель». Это три сходящихся фактора.

Во-первых, планка возможностей быстро растёт. Kimi K3 демонстрирует, что открытые модели теперь могут справляться с задачами, которые ранее были прерогативой передовых проприетарных систем: многочасовые автономные сессии программирования, создание компиляторов, реализация исследовательских работ. Практический разрыв между «открытыми» и «передовыми» моделями сужается до точки, где для многих бизнес-задач он уже не оправдывает премию за закрытые API.

Во-вторых, меняется экономика. Запуск модели на собственной инфраструктуре — даже большой — меняет структуру затрат. Вместо оплаты посимвольных ставок API, которые растут линейно с использованием, команды инвестируют в GPU-мощности и запускают инференс с маржинальной стоимостью. Для организаций с устойчивыми AI-нагрузками математика всё больше склоняется в пользу самостоятельного размещения. Компромисс «самостоятельное размещение vs. SaaS» стоит просчитать на калькуляторе для любой команды, тратящей более нескольких сотен долларов ежемесячно на вызовы API.

В-третьих, окно контекста в 1 млн токенов важно для агентов. AI-агенты, работающие с большими кодовыми базами, длинными документами или многоэтапными исследовательскими цепочками, нуждаются в значительном контексте для поддержания связности. Миллион токенов — с открытыми весами — означает, что самостоятельно размещённые агентные системы могут решать реальные сложные задачи без постоянного сжатия контекста или стратегий нарезки.

Для команд, работающих с самостоятельно размещённым AI-отделом, такая открытая модель, как Kimi K3 — именно тот тип разработки, который делает подход с собственной моделью ключевым. Как только веса станут доступны, вы сможете направить своего кодера на Kimi K3 для сложных инженерных задач, оставить исследователя на модели среднего уровня, а задачи форматирования или сжатия запускать на маленькой локальной модели — всё на собственном железе, без подписки на каждое рабочее место и без утечки данных из вашей инфраструктуры. Ландшафт моделей меняется быстро; владение своим рантаймом означает, что вы извлекаете выгоду из каждого нового открытого релиза, а не только из того, что ваш SaaS-вендор решит интегрировать.

Купить — 15 400 ₽

Практическая реальность

Есть оговорки, на которые стоит обратить внимание. Запуск MoE-модели с 2.8 трлн параметров при приемлемой задержке требует серьёзной GPU-инфраструктуры — скорее всего, нескольких высокопроизводительных карт. В источнике не указаны точные аппаратные требования для самостоятельного инференса. Moonshot заявляет, что «в настоящее время тесно сотрудничает с партнёрами по инференсу и сопровождающими open-source проектами для согласования технических деталей и обеспечения надёжного развёртывания по всей экосистеме» — сигнал о том, что развёртывание не будет тривиальным с первого дня.

Также модель по умолчанию запускается с максимальным усилием мышления, а настраиваемые режимы усилия появятся позже. Для чувствительных к затратам самостоятельных развёртываний возможность уменьшить усилие мышления будет важна — сжигать полные вычислительные ресурсы на простую задачу форматирования расточительно.

Полный технический отчёт, охватывающий архитектуру, детали обучения и оценки, ещё не опубликован, но обещан вместе с выпуском весов.

Общая картина

Девять из последних двенадцати месяцев модели Moonshot задавали верхнюю границу размера открытых моделей. Kimi K3 продолжает эту траекторию, но настоящая история — не в количестве параметров, а в продемонстрированных возможностях. Модель, способная с нуля создавать компиляторы, проектировать функциональные чипы и сжимать две недели исследований в два часа, — это качественно другой инструмент, нежели тот, что был доступен самостоятельно размещённым командам ещё год назад.

Выпуск с открытыми весами 27 июля станет настоящим тестом. Оптимизация инференса, инструментарий сообщества, усилия по квантизации и поддержка фреймворков определят, насколько практично K3 станет доступна командам без бюджетов гиперскейлеров. Но направление однозначно: рассуждения класса «фронт» становятся чем-то, чем вы владеете, а не чем-то, что вы арендуете.

Команды, строящие решения на самостоятельно размещённой инфраструктуре сегодня — будь то через платформы вроде OfficeForge или кастомные стеки — расположены извлечь максимальную выгоду из этого сдвига. Когда вы контролируете свой рантайм и выбор моделей, каждый новый выпуск с открытыми весами — это апгрейд возможностей, который вы можете принять в собственном темпе, с собственными затратами и с данными, остающимися именно там, где им место.

FAQ

Что такое Kimi K3?

Kimi K3 — это открытая модель с 2.8 трлн параметров от Moonshot AI, оснащённая технологией Kimi Delta Attention, нативным зрением и окном контекста в 1 млн токенов. Это первая в мире открытая модель в классе параметров 3T.

Когда будут выпущены веса Kimi K3?

Согласно объявлению Moonshot AI, полные веса модели будут выпущены до 27 июля 2026 года.

Как Kimi K3 соотносится с проприетарными моделями?

Хотя по общему качеству она всё ещё уступает самым мощным проприетарным моделям — в частности, Claude Fable 5 и GPT 5.6 Sol — Kimi K3 стабильно превзошла все остальные протестированные модели в наборе оценок Moonshot AI.

Какие архитектурные инновации использует Kimi K3?

Kimi K3 построена на базе Kimi Delta Attention (KDA) и Attention Residuals (AttnRes) в сочетании с фреймворком Stable LatentMoE, который активирует 16 из 896 экспертов. Вместе они дают примерно 2.5-кратное улучшение эффективности масштабирования по сравнению с Kimi K2.

Смогут ли самостоятельно размещённые команды запустить Kimi K3 после выхода весов?

Как только открытые веса будут выпущены, команды с достаточной GPU-инфраструктурой смогут запустить модель локально. Доступ через API доступен уже сегодня через платформы Kimi для команд, которые хотят начать строить решения на K3 немедленно.

🛠

Эту статью собрала, написала и оформила ИИ-команда OfficeForge — Андрей (ресёрч), Кирилл (текст), Алла (оформление) — те самые пять ИИ-сотрудников, что идут в продукте. Направляет основатель, проверено командой. Блог — это наш продукт за реальной работой.

Эту статью сделала та же ИИ-команда, которую вы можете посадить на свою доску задач. Собрать свою команду →
Уже в продаже

Запусти свою ИИ-команду

Разовая покупка, твой сервер, твои данные. Ключ приходит на почту сразу.

Купить — 15 400 ₽