Moonshot AI официально представила Kimi K3, модель с 2.8 трлн параметров, которая претендует на звание первой в мире открытой модели класса 3T. Анонс, освещённый в официальном блоге Kimi K3, знаменует значимый сдвиг для команд, создающих AI-пайплайны на собственной инфраструктуре: модель, приближающаяся к передовому уровню рассуждений — с открытыми весами, которые появятся к 27 июля 2026 года.
На сегодня модель доступна на Kimi.com, Kimi Work, Kimi Code и в Kimi API. Но ключевое событие для самостоятельно размещённых команд — это скорый выпуск с открытыми весами. Впервые модель такого класса параметров можно будет скачать и запустить за пределами облака одного вендора.
Что из себя представляет Kimi K3
Kimi K3 построена на двух архитектурных инновациях: Kimi Delta Attention (KDA) и Attention Residuals (AttnRes), разработанных для улучшения потока информации как по длине последовательности, так и по глубине модели — что критически важно для работы с окном контекста в 1 млн токенов.
Модель использует архитектуру Mixture of Experts (MoE) со значительной разреженностью: при каждом прямом проходе активируется только 16 из 896 экспертов в сочетании с тем, что Moonshot называет фреймворком Stable LatentMoE. Эта стратегия разреженной активации делает модель с 2.8 трлн параметров практичной для запуска — большинство параметров остаются бездействующими в ходе любого конкретного вызова инференса.
Mixture of Experts (MoE): Архитектура, в которой модель содержит множество подсетей («экспертов»), но только подмножество из них активируется для каждого входа. Это позволяет удерживать стоимость инференса близкой к стоимости для гораздо меньшей плотной модели, сохраняя при этом ёмкость знаний полного количества параметров.
В сочетании с улучшенными рецептами обучения и данных эти структурные изменения дают то, что Moonshot описывает как примерно 2.5-кратное улучшение общей эффективности масштабирования по сравнению с предыдущей моделью Kimi K2 — то есть тот же бюджет вычислений даёт значительно бо́льшие возможности.
Модель поставляется с нативными возможностями зрения и по умолчанию запускается с максимальным усилием мышления; настраиваемые режимы с низким и высоким усилием запланированы на более поздние обновления.
Производительность: вблизи передового рубежа
В наборе оценок Moonshot модель Kimi K3 стабильно превосходила все другие протестированные модели — за двумя исключениями. Она всё ещё уступает Claude Fable 5 и GPT 5.6 Sol по общему качеству. Но разрыв достаточно узок, чтобы для многих практических задач разница могла не иметь значения — особенно когда команды смогут запускать K3 на собственном железе без посимвольной оплаты API.
Полные детали бенчмарков обещаны вместе с техническим отчётом в момент выпуска весов. Что Moonshot опубликовала сейчас — это детальные оценки по программированию, и они наиболее показательны.
Программирование: самый сильный сигнал
Самые убедительные демонстрации Kimi K3 связаны с инженерными задачами на длинном горизонте — именно тот вид работы, за который автономные AI-агенты и ценятся.
Оптимизация ядер
Moonshot протестировала способность модели оптимизировать ядра GPU по четырём задачам, охватывающим AttnRes, KDA и ядро MLA с размерностью 512 голов. Каждая модель работала независимо в идентичной песочнице, име до 24 часов на профилирование, перезапуск и бенчмаркинг на NVIDIA H200 и GPU оборудования от альтернативного вендора.
Результаты: Kimi K3 продемонстрировала конкурентоспособные результаты с Claude Fable 5 — с оговоркой, что результаты Fable 5 могут включать поведение отката и оценивались третьей стороной. Она существенно превзошла Opus 4.8, GPT 5.6 Sol и GPT 5.5. Примечательно, что на поздних этапах разработки ранняя версия Kimi K3 взяла на себя большую часть работы команды Kimi по оптимизации собственных ядер — модель «ест свою собственную еду».
Создание компилятора с нуля
В более амбициозном тесте Kimi K3 создала MiniTriton — компактный компилятор, похожий на Triton, с нуля, включая собственный IR-уровень поверх MLIR, проходы оптимизации и пайплайн генерации PTX-кода. Это не патчинг существующего кода; это построение целого инструментария компиляции.
MiniTriton демонстрирует производительность на уровне или выше, чем Triton и torch.compile на поддерживаемых бенчмарках, и превосходит Triton на некоторых задачах. Также он поддерживает сквозное обучение nanoGPT со стабильной сходимостью, кривая потерь closely следует за эталоном — валидация полного пайплайна на реалистичной задаче.
Визуальная разработка и проектирование чипов
Kimi K3 объединяет 3D-рассуждения, кодирование и зрение, чтобы превращать концепции и изображения в интерактивные опытные образцы, итерируя между кодом и живыми скриншотами в рабочем процессе «зрение в цикле».
Пожалуй, самая поразительная демонстрация: в рамках одного 48-часового автономного запуска Kimi K3 спроектировала, оптимизировала и верифицировала чип с использованием инструментов EDA с открытым исходным кодом на библиотеке Nangate 45nm. Получившийся чип площадью 4 мм² закрывает тайминг на 100 МГц и поддерживает пропускную способность декодирования свыше 8700 токен/с в симуляции, вмещая 1.46 млн стандартных ячеек, 0.277 МБ SRAM и массив INT4 MAC со слитой деквантизацией. Чип, построенный моделью — для модели — конкретная демонстрация возможности агента на длинном горизонте.
Ускорение исследований
В вычислительной астрофизике Kimi K3 автономно проверила и перекрёстно валидировала более 20 статей, а затем реализовала полный числовой пайплайн для воспроизведения универсальных соотношений I–Love–Q. По словам Moonshot, задача была выполнена примерно за два часа — работа, которая обычно занимает одну-две недели у опытного исследователя.
Что это значит для самостоятельно размещённых команд
Значимость для команд, работающих на самостоятельно размещённом AI, — это не просто «более крупная модель». Это три сходящихся фактора.
Во-первых, планка возможностей быстро растёт. Kimi K3 демонстрирует, что открытые модели теперь могут справляться с задачами, которые ранее были прерогативой передовых проприетарных систем: многочасовые автономные сессии программирования, создание компиляторов, реализация исследовательских работ. Практический разрыв между «открытыми» и «передовыми» моделями сужается до точки, где для многих бизнес-задач он уже не оправдывает премию за закрытые API.
Во-вторых, меняется экономика. Запуск модели на собственной инфраструктуре — даже большой — меняет структуру затрат. Вместо оплаты посимвольных ставок API, которые растут линейно с использованием, команды инвестируют в GPU-мощности и запускают инференс с маржинальной стоимостью. Для организаций с устойчивыми AI-нагрузками математика всё больше склоняется в пользу самостоятельного размещения. Компромисс «самостоятельное размещение vs. SaaS» стоит просчитать на калькуляторе для любой команды, тратящей более нескольких сотен долларов ежемесячно на вызовы API.
В-третьих, окно контекста в 1 млн токенов важно для агентов. AI-агенты, работающие с большими кодовыми базами, длинными документами или многоэтапными исследовательскими цепочками, нуждаются в значительном контексте для поддержания связности. Миллион токенов — с открытыми весами — означает, что самостоятельно размещённые агентные системы могут решать реальные сложные задачи без постоянного сжатия контекста или стратегий нарезки.
Для команд, работающих с самостоятельно размещённым AI-отделом, такая открытая модель, как Kimi K3 — именно тот тип разработки, который делает подход с собственной моделью ключевым. Как только веса станут доступны, вы сможете направить своего кодера на Kimi K3 для сложных инженерных задач, оставить исследователя на модели среднего уровня, а задачи форматирования или сжатия запускать на маленькой локальной модели — всё на собственном железе, без подписки на каждое рабочее место и без утечки данных из вашей инфраструктуры. Ландшафт моделей меняется быстро; владение своим рантаймом означает, что вы извлекаете выгоду из каждого нового открытого релиза, а не только из того, что ваш SaaS-вендор решит интегрировать.
Купить — 15 400 ₽Практическая реальность
Есть оговорки, на которые стоит обратить внимание. Запуск MoE-модели с 2.8 трлн параметров при приемлемой задержке требует серьёзной GPU-инфраструктуры — скорее всего, нескольких высокопроизводительных карт. В источнике не указаны точные аппаратные требования для самостоятельного инференса. Moonshot заявляет, что «в настоящее время тесно сотрудничает с партнёрами по инференсу и сопровождающими open-source проектами для согласования технических деталей и обеспечения надёжного развёртывания по всей экосистеме» — сигнал о том, что развёртывание не будет тривиальным с первого дня.
Также модель по умолчанию запускается с максимальным усилием мышления, а настраиваемые режимы усилия появятся позже. Для чувствительных к затратам самостоятельных развёртываний возможность уменьшить усилие мышления будет важна — сжигать полные вычислительные ресурсы на простую задачу форматирования расточительно.
Полный технический отчёт, охватывающий архитектуру, детали обучения и оценки, ещё не опубликован, но обещан вместе с выпуском весов.
Общая картина
Девять из последних двенадцати месяцев модели Moonshot задавали верхнюю границу размера открытых моделей. Kimi K3 продолжает эту траекторию, но настоящая история — не в количестве параметров, а в продемонстрированных возможностях. Модель, способная с нуля создавать компиляторы, проектировать функциональные чипы и сжимать две недели исследований в два часа, — это качественно другой инструмент, нежели тот, что был доступен самостоятельно размещённым командам ещё год назад.
Выпуск с открытыми весами 27 июля станет настоящим тестом. Оптимизация инференса, инструментарий сообщества, усилия по квантизации и поддержка фреймворков определят, насколько практично K3 станет доступна командам без бюджетов гиперскейлеров. Но направление однозначно: рассуждения класса «фронт» становятся чем-то, чем вы владеете, а не чем-то, что вы арендуете.
Команды, строящие решения на самостоятельно размещённой инфраструктуре сегодня — будь то через платформы вроде OfficeForge или кастомные стеки — расположены извлечь максимальную выгоду из этого сдвига. Когда вы контролируете свой рантайм и выбор моделей, каждый новый выпуск с открытыми весами — это апгрейд возможностей, который вы можете принять в собственном темпе, с собственными затратами и с данными, остающимися именно там, где им место.
FAQ
Что такое Kimi K3?
Kimi K3 — это открытая модель с 2.8 трлн параметров от Moonshot AI, оснащённая технологией Kimi Delta Attention, нативным зрением и окном контекста в 1 млн токенов. Это первая в мире открытая модель в классе параметров 3T.
Когда будут выпущены веса Kimi K3?
Согласно объявлению Moonshot AI, полные веса модели будут выпущены до 27 июля 2026 года.
Как Kimi K3 соотносится с проприетарными моделями?
Хотя по общему качеству она всё ещё уступает самым мощным проприетарным моделям — в частности, Claude Fable 5 и GPT 5.6 Sol — Kimi K3 стабильно превзошла все остальные протестированные модели в наборе оценок Moonshot AI.
Какие архитектурные инновации использует Kimi K3?
Kimi K3 построена на базе Kimi Delta Attention (KDA) и Attention Residuals (AttnRes) в сочетании с фреймворком Stable LatentMoE, который активирует 16 из 896 экспертов. Вместе они дают примерно 2.5-кратное улучшение эффективности масштабирования по сравнению с Kimi K2.
Смогут ли самостоятельно размещённые команды запустить Kimi K3 после выхода весов?
Как только открытые веса будут выпущены, команды с достаточной GPU-инфраструктурой смогут запустить модель локально. Доступ через API доступен уже сегодня через платформы Kimi для команд, которые хотят начать строить решения на K3 немедленно.
