15 июля 2026 года Thinking Machines Lab выпустила Inkling — трансформер с архитектурой mixture-of-experts и открытыми весами, имеющий 975 миллиардов общих параметров и 41 миллиард активных. Эта модель создана не для того, чтобы возглавлять рейтинги. Она создана для того, чтобы на ней строили.
Это различие важнее, чем может показаться. В ландшафте, где каждый релиз подаётся как новый чемпион лидерских досок, Inkling занимает принципиально иную позицию: это широкая мультимодальная базовая модель, оптимизированная для команд, которые хотят настраивать, кастомизировать и развертывать собственные варианты — а не просто потреблять чей-то API.
Что такое Inkling на самом деле
Inkling — это трансформер с архитектурой Mixture-of-Experts (MoE). :::def Mixture-of-Experts (MoE) — это архитектура, в которой для любого входного сигнала активируется только подмножество параметров модели. Это позволяет модели иметь очень большой общий запас параметров, сохраняя при этом стоимость инференса пропорциональной меньшему «активному» размеру. :::
Цифры чётко говорят о приоритетах в дизайне:
- 975 млрд общих параметров, но только 41 млрд активных на один прямой проход — это означает, что стоимость инференса масштабируется от цифры в 41 млрд, а не от полных 975 млрд.
- Контекстное окно в 1 млн токенов — достаточно большое, чтобы обрабатывать целые кодовые базы, длинные документы или развёрнутые многораундовые диалоги за один проход.
- Предварительно обучена на 45 триллионах токенов текста, изображений, аудио и видео — по-настоящему мультимодальный тренировочный корпус.
- Встроенное рассуждение по тексту, изображениям и аудио с тем, что команда называет «эффективным и контролируемым усилием мышления» — системой для балансировки вычислительных затрат и глубины рассуждения.
Модель поставляется вместе с превью Inkling-Small, более лёгкого варианта с 12 млрд активных параметров, обученного по аналогичной технологии и нацеленного на случаи, где стоимость и задержки важнее raw-мощности.
Thinking Machines Lab описывает Inkling как «первую в семействе моделей разного размера» и даёт понять, что размеров будет больше.
Философия: кастомизация важнее погони за баллами
Здесь Inkling становится интересной для инженерных команд, а не только для энтузиастов ML-бенчмарков.
Команда отрадно откровенна: Inkling «не является на сегодня самой мощной моделью из всех доступных, открытых или закрытых». Вместо этого они утверждают, что именно *сочетание* качеств делает её ценной в качестве основы:
1. Мультимодальные возможности по тексту, изображениям и аудио — не просто «текст на входе — текст на выходе». 2. Эффективное мышление — контролируемое распределение вычислений, позволяющее снижать затраты на простые задачи и повышать их для сложных. 3. Доступность в Tinker для тонкой настройки с первого дня.
Это принципиально другой посыл, нежели «мы обходим GPT-5 по MMLU». Здесь говорится: базовая модель — это *отправная точка*, а настоящая ценность возникает, когда команды формируют её под свой домен, свой стиль и свои ограничения. Thinking Machines Lab явно определяет свою миссию как создание «ИИ, расширяющего волю и суждение человека» — и позиционирует кастомизация как механизм для этого.
Для команд, оценивающих базовые модели, это переформулирует вопрос с «какая модель набирает самый высокий балл?» на «какая модель лучше всего настраивается под *мой* случай использования, в рамках *моих* допустимых затрат, на *моей* инфраструктуре?»
Демо само-тюнинга: Inkling настраивает себя сама
Чтобы продемонстрировать, как выглядит кастомизация на практике, Thinking Machines Lab сделали нечто поразительное: они попросили Inkling дообучить саму себя.
Промпт предложил Inkling стать липограммной моделью — такой, которая никогда не использует букву «е» в каком-либо выводе. Это ограничение, которое один лишь промптинг не может надёжно обеспечить; для этого требуется реальная модификация весов. Тогда Inkling:
1. Написала свою собственную цель для тонкой настройки (objective.py) — определив функцию оценки, которая возвращает 0.0, если в выводе появляется «е», и 10.0 в противном случае. 2. Настроила и запустила свой собственный тренировочный процесс в Tinker — 32 батча × 3 эпохи = 96 шагов. 3. Выжидала примерно 27 минут до завершения обучения. 4. Оценила результат относительно базовой модели. 5. Подготовила само-обновление для переключения своих весов на дообученный чекпоинт.
После обновления Inkling отвечала на вопросы, не используя букву «е», — продемонстрировав, что тонкая настройка действительно сработала. Весь цикл — написание кода, обучение, оценка, развёртывание — произошёл автономно в рамках среды Tinker.
Это убедительное демо не потому, что липограммы полезны, а потому, что оно показывает пайплайн: задайте поведение, которое не להשיג промптингом, позвольте модели построить собственную тренировочную задачу, запустите её и разверните. Тот же самый цикл работает для доменной терминологии, ограничений комплаенса, калибровки тона или паттернов рассуждения для конкретных задач.
Почему это важно для self-hosted команд
Для команд, запускающих ИИ на собственной инфраструктуре — будь то ради суверенитета данных, контроля затрат или соблюдения нормативных требований, — выход Inkling гораздо значимее, чем ещё одна закрытая модель с доступом через API.
Вот почему:
Полный доступ к весам означает полный контроль. Веса находятся в открытом доступе, размещены на Hugging Face. Вы можете скачать их, запустить на своём оборудовании, дообучить и развернуть варианты, ни разу не отправив данные в стороннюю инференс-конечную точку.
Экономика MoE благоприятствует self-hosting. При 41 млрд активных параметров стоимость инференса Inkling значительно ниже, чем у плотной модели на 975 млрд. Для команд, обеспечивающих GPU-мощности на собственных VPS или выделенных серверах, это напрямую translates в снижение аппаратных требований на один запрос при сохранении широты знаний гораздо более крупной модели.
Тонкая настройка — первоклассная функция, а не побочная. Платформа Tinker изначально спроектирована вокруг кастомизации. Inkling Playground даёт разработчикам прямой интерфейс для оценки базовой модели перед тем, как определиться с направлением тонкой настройки. А демо само-тюнинга показывает, что инструментарий достаточно зрел для автоматизированных тренировочных циклов — а не только для ручных экспериментов.
Мультимодальность из коробки. Многие модели с открытыми весами являются текстовыми или имеют прикрученное зрение. Inkling рассуждает нативно по тексту, изображениям и аудио из одной модели, что упрощает развёртывание для команд, которым нужно обрабатывать документы со встроенными изображениями, транскрибировать аудио или работать со смешанными медиавходами без оркестрации нескольких специализированных моделей.
Для команд, управляющих собственным ИИ-стеком: Модели с открытыми весами, такие как Inkling, — это именно тот тип фундамента, который делает self-hosted ИИ практичным. Вы контролируете модель, данные и тюнинг — ничего не покидает вашу инфраструктуру. Если вы изучаете, как построить ИИ-команду на своём VPS без посуточных SaaS-расходов или утечки данных, посмотрите, как self-hosted ИИ-команда OfficeForge запускает пять специализированных агентов на вашем собственном сервере, работая с моделями, которыми вы владеете.
Купить — 15 400 ₽Общая картина: базовые модели как отправные точки
Выход Inkling отражает более широкий сдвиг в том, как серьёзные команды думают об ИИ-инфраструктуре.
Первая волна внедрения LLM была связана с потреблением моделей как сервиса — отправь промпт, получи ответ, плати за токен. Эта модель подходит для прототипирования и узких задач, но она создаёт жёсткие потолки: вы не можете изменить поведение модели сверх промптинга, не можете контролировать, куда уходят ваши данные, а ваши расходы линейно масштабируются вечно вместе с использованием.
Вторая волна — частью которой Inkling является несомненно — связана с тем, чтобы *владеть* своим фундаментом. Скачай веса. Обучи на своих доменных данных. Разверни на своём оборудовании. Базовая модель — это *отправная точка*, а не готовый продукт.
Этот сдвиг имеет практические последствия:
- Структура затрат меняется. Вместо вечной оплаты за токен вы инвестируете в вычисления вперед для тонкой настройки, а затем запускаете инференс на своих условиях. Для команд с предсказуемыми, объёмными рабочими нагрузками математика быстро склоняется в пользу self-hosting.
- Данные остаются на своём месте. Регуляторные фреймворки в финансах, здравоохранении, юриспруденции и государственном секторе всё чаще требуют суверенитета данных. Модели с открытыми весами на self-hosted инфраструктуре прямо отвечают на этот запрос.
- Кастомизация даёт кумулятивный эффект. Дообученная модель, которая кодирует ваши доменные знания, вашу терминологию и ваши стандарты качества, становится вашим проприетарным активом — а не коммодити-эндпоинтом, к которому имеет доступ кто угодно.
Явное позиционирование Thinking Machines Lab — «мы хотим сделать кастомизацию доступной для большего числа случаев использования» — говорит о том, что они понимают эту динамику. Семейство моделей будет расти (Inkling-Small уже показана в превью), и платформа Tinker, вероятно, будет расширяться вместе с ней.
Для инженерных команд вывод прост: эпоха выбора между «мощным, но закрытым» и «открытым, но слабым» подходит к концу. Модели вроде Inkling предлагают средний путь — по-настоящему capable, мультимодальные, эффективные в инференсе и предназначенные для того, чтобы их формировали, а не просто потребляли.
Команды, которые извлекут наибольшую выгоду, — это не те, кто гонится за самым высоким баллом в бенчмарке. Это те, кто возьмёт прочный фундамент с открытыми весами, дообучит его под свою конкретную реальность и запустит на инфраструктуре, которой они владеют. На это делает ставку Thinking Machines Lab с Inkling — и для self-hosted команд это ставка, за которой стоит следить внимательно.
FAQ
Что такое Inkling?
Inkling — это трансформер с архитектурой mixture-of-experts и открытыми весами, имеющий 975 млрд общих параметров и 41 млрд активных, выпущенный Thinking Machines Lab. Модель поддерживает текст, изображения и аудио, работает с контекстным окном в 1 млн токенов и создана для тонкой настройки через платформу Tinker.
Является ли Inkling самой мощной доступной моделью?
Нет. Thinking Machines Lab прямо заявляет, что Inkling «не является на сегодня самой мощной моделью из всех доступных, открытых или закрытых». Она создана как прочная основа для кастомизации, а не как лидер бенчмарков.
Что такое Tinker?
Tinker — это платформа Thinking Machines Lab для тонкой настройки моделей. Inkling доступна для тонкой настройки в Tinker с первого дня выхода, а для тестирования предусмотрен ориентированный на разработчиков Inkling Playground.
Что такое Inkling-Small?
Inkling-Small — это облегчённая предварительная версия модели с 12 млрд активных параметров, обученная по аналогичной технологии. Она предназначена для достижения высокой производительности при сниженных затратах и задержках.
Можно ли развернуть и дообучить Inkling на своей инфраструктуре?
Да. Полные веса Inkling находятся в открытом доступе, и её можно дообучить через Tinker. Для команд, управляющих собственной инфраструктурой, это означает полный контроль над данными и поведением модели без необходимости полагаться на сторонние API для каждой задачи.
