
Kimi K3: полный обзор флагманской модели Moonshot на 2.8T
Kimi K3: архитектура, цены и API с контекстом 1M, постоянным рассуждением, фиксированным сэмплингом и совместимостью с OpenAI.
Moonshot AI выпустила Kimi K3 в середине июля 2026 года, но сделала это в обратном порядке: документация API, страница цен и рабочий ID модели kimi-k3 появились раньше таблицы бенчмарков, технической статьи и весов[1]. Информационный вакуум на неделю заполнили обсуждения утечек, и почти в каждой версии хотя бы один параметр был указан неверно. Это руководство опирается на собственную документацию Moonshot и разделяет подтвержденные сведения, намеренно фиксированные настройки и еще не опубликованные данные.
У нас также есть конкретная точка зрения: Kimi K3 работает через шлюз reAPI. Поэтому ниже разобрана не только сама модель, но и ее реальные вызовы — параметры, из-за которых запрос отклонят, влияние кэша на счет и ловушки миграции кода K2.x.
Кратко
- Kimi K3 — флагман на 2.8 триллиона параметров, построенный на гибридном механизме линейного внимания Kimi Delta Attention и Attention Residuals. Stable LatentMoE активирует 16 из 896 экспертов на token[1][3].
- Окно контекста составляет 1 048 576 tokens с единым тарифом, без надбавки за длинный контекст. В нативном API Moonshot лимит вывода по умолчанию равен 131 072 и может достигать 1 048 576, если сумма входа и лимита помещается в окно[1][2][9].
- Рассуждение включено всегда. Единственная настройка — трехуровневый
reasoning_effort(low/high/max, безmedium), по умолчаниюmax[4]. - Сэмплинг заблокирован:
temperature1.0,top_p0.95,n1, оба штрафа 0. Другое значение возвращает ошибку[1]. - Опубликованный тариф Moonshot — $3.00 за вход / $15.00 за выход на 1M tokens ($0.30 за вход при попадании в кэш). В reAPI та же модель стоит $2.50 / $12.00, дешевле по обеим позициям[2][8].
- Изображения и видео принимаются нативно, но публичные URL изображений отклоняются. Нужен base64 или ссылка на загруженный файл[5].
Kimi K3 в цифрах
Все сведения в таблице взяты из документации Moonshot API, полученной 26 июля 2026 года:
| Характеристика | Kimi K3 (официально) |
|---|---|
| ID модели | kimi-k3 |
| Всего параметров | 2.8 триллиона |
| Архитектура | Kimi Delta Attention (гибридное линейное внимание) + Attention Residuals; Stable LatentMoE, активны 16 из 896 экспертов |
| Окно контекста | 1,048,576 tokens (1M) |
| Максимальный вывод | Нативное значение по умолчанию 131 072 tokens; предел параметра 1 048 576, если вход и лимит вместе помещаются в контекст [9] |
| Модальности | текст, изображение и видео на входе; текст на выходе |
| Рассуждение | всегда включено; reasoning_effort со значениями low / high / max, по умолчанию max |
| Цена входа (без кэша) | $3.00 за 1M tokens |
| Цена входа (с кэшем) | $0.30 за 1M tokens |
| Цена выхода | $15.00 за 1M tokens |
| Уровни контекста | нет — единый тариф за token при любой длине |
Две цифры требуют внимания. Размер 2.8T выводит K3 в класс, где еще не было моделей с открытыми весами. Moonshot обещала опубликовать веса, что сделает ее первой open-source моделью класса 3 триллионов[3]. Вторая цифра — цена. При $3.00 / $15.00 K3 стоит в три-четыре раза дороже линейки K2. Moonshot оценивает ее как передовой флагман, а не как бюджетную модель, с которой раньше ассоциировалась Kimi, но все же дешевле закрытых передовых моделей и на входе, и на выходе.
Запуск: сначала API, затем доказательства
Порядок запуска объясняет противоречивые сведения. До релиза наблюдатели заметили промостраницу на платформе Moonshot и beta-переключатели в приложении Kimi. Утечки сошлись на «примерно 2.5T параметров и контекст 1M». Близко, но официальная цифра — 2.8T. Затем официальный аккаунт Moonshot показал ролик без текста, а продукт опередил прессу: документация API, быстрый старт и цены вышли в тот же день, что и первые финансовые публикации о запуске[1][2].
Такая последовательность — API и документация до бенчмарков и весов — противоположна запуску флагманов K2, которые получали техническую статью и открытые веса в первый день. Поэтому первую неделю жизни K3 документация была единственным надежным источником, а остальное оставалось предположениями.
Архитектура: Kimi Delta Attention, LatentMoE, Attention Residuals
Самая интересная техническая строка сообщает, что K3 «построена на Kimi Delta Attention, гибридном механизме линейного внимания, и Attention Residuals»[3]. Это не маркетинг, а промышленное применение исследования Kimi Linear, опубликованного Moonshot в конце 2025 года. Оно объясняет и окно 1M tokens, и единый тариф, делающий его практичным[6].
Kimi Delta Attention (KDA) — механизм линейного внимания, развитие Gated DeltaNet с более точным гейтингом. Кэш ключей и значений стандартного softmax-внимания растет линейно с последовательностью, поэтому контекст в миллион tokens крайне дорог. Линейное внимание хранит рекуррентное состояние фиксированного размера. Исторически платой было качество: чистое линейное внимание хуже вспоминает точные детали длинных документов.
Гибридная схема решает компромисс в статье Kimi Linear: слои KDA чередуются с полным вниманием в пропорции 3:1. Три слоя из четырех используют дешевый линейный механизм, четвертый сохраняет точное глобальное внимание. В опубликованных результатах схема превзошла полное внимание по качеству, сократила память KV-cache до 75% и ускорила декодирование до 6x в контексте 1M tokens[6].
Stable LatentMoE — разреженная mixture-of-experts: 896 экспертов, 16 активны для каждого token[3]. Разреженность позволяет обслуживать модель 2.8T: активные вычисления используют лишь малую часть всех параметров.
Attention Residuals — единственный компонент без опубликованной статьи; термин впервые появился в документации K3. Пока нет технического отчета, мы знаем название, но не механизм.
Практический смысл в том, что окно 1M tokens полезно только при приемлемой цене. Большинство провайдеров длинного контекста повышают тариф или незаметно снижают качество. У K3 уровней нет: 5,000 и 900,000 tokens оплачиваются по одной ставке[2]. Это разумно, только если предельная стоимость длинного контекста действительно упала, для чего и создан KDA. Архитектура объясняет цену.
Что на самом деле поставляет API
API K3 задает жесткие правила, способные удивить команды после K2.x или OpenAI-подобных моделей. Это документированные ограничения, не наблюдения[1]:
- Рассуждение всегда включено. Режима без мышления нет. FAQ Moonshot прямо отвечает на вопрос об отключении цепочки рассуждений: никак. Поле верхнего уровня
reasoning_effortпринимаетlow,highиmax.mediumотсутствует, а самый дорогойmaxзадан по умолчанию[4]. - Сэмплинг фиксирован.
temperatureравна 1.0,top_p0.95,n1, оба штрафа 0. Иные значения вызывают ошибку, поэтому поля нужно убрать. Если процесс менял temperature по задаче, такого рычага больше нет. - Бюджет вывода должен помещаться в окно вместе со входом. В нативном API Moonshot
max_completion_tokensпо умолчанию равен 131 072 и может достигать 1 048 576. Если сумма входа и лимита превышает контекст, API возвращаетinvalid_request_error. Максимальное значение параметра не гарантирует итоговый ответ на миллион tokens. Задавайте лимит явно, оставляя место для входа, рассуждений и ответа[9]. - Стриминг разделяет рассуждение и ответ. Ответ передает delta
reasoning_contentотдельно от deltacontent, позволяя интерфейсу раздельно показывать ход мысли и итог. - Preserved Thinking обязателен. В многоходовых и инструментальных циклах полное сообщение assistant, включая
reasoning_contentиtool_calls, нужно без изменений возвращать вmessages. Сохранение толькоcontent, привычное для OpenAI-подобного кода, незаметно ухудшает модель. - У зрения есть строгие ограничения. Изображения и видео нативны, но публичные URL изображений не принимаются. Используйте URI base64 или загрузите файл и передайте его ID[5].
- Структурированный вывод — штатная функция. JSON Schema с
strict: trueограничивает итоговый ответ, но не рассуждение в прозе.
Новый стек вызова инструментов
В K3 дебютируют две функции. Обе решают одну проблему: агенты с множеством инструментов тратят контекст на их определения[1].
tool_choice: "required" требует хотя бы один вызов инструмента за ход. Агент не ответит по памяти, когда обязан выполнить поиск. K2 отклоняет это значение, K3 принимает.
Динамическая загрузка инструментов работает необычнее: добавьте полное определение в сообщение system посреди диалога, с полем tools и без content. С этого момента инструмент доступен. Вместо 80 схем в начале каждого запроса оркестратор вводит нужные в конкретной фазе. Сервер не хранит такой инструмент: если убрать system-сообщение из истории, в следующем ходе он исчезнет.
Документация предупреждает: встроенный web_search Moonshot обновляется и сейчас не рекомендован для production. Для поиска подключайте собственный инструмент.
Автоматический кэш контекста
Кэш K3 не требует ID, управления TTL и параметров. Сохраняйте длинный префикс стабильным, и платформа автоматически попытается использовать кэш, выставив $0.30 вместо $3.00 за 1M tokens[1]. Скидка на повторный контекст составляет 90% и превращает окно 1M в рабочий прием: загрузите корпус стабильным префиксом и запрашивайте его за десятую часть цены.
Есть два условия. Prompt предыдущего запроса должен превышать 256 tokens; меньшее не кэшируется. Уровень reasoning_effort нельзя менять: переключение внутри диалога инвалидирует префикс[4]. Выберите уровень заранее.
Ранняя сторонняя телеметрия подтверждает механизм: статистика K3 в OpenRouter показывала более 75% попаданий, снижая среднюю взвешенную цену входа намного ниже трети прайса[7].
Цена: намеренный отказ от бюджетной стратегии
Все прежние Kimi конкурировали прежде всего стоимостью. K3 — нет. Ниже положение в семье и среди передовых моделей, за 1M tokens и без кэша на входе:
| Модель | Вход | Выход | Вход с кэшем | Контекст |
|---|---|---|---|---|
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K3 (напрямую Moonshot) | $3.00 | $15.00 | $0.30 | 1M |
| Kimi K3 в reAPI | $2.50 | $12.00 | — | 1M |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 1M |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
Позиция очевидна: K3 в три-четыре раза дороже родственных моделей и на 40–50% дешевле закрытых передовых. Moonshot считает, что окно 1M tokens, нативное видео и передовые возможности оправдывают премиальный уровень среди открытых весов.
Скорость — честная оговорка. Ранние измерения дают K3 около 28 tokens в секунду и четыре секунды до первого token[7]. Для постоянно рассуждающей модели такого размера ожидаемо, но медленно. K3 создана для глубины одного вызова, а не их числа в минуту; чувствительным к задержке циклам нужна другая модель.
Еще одна деталь: Moonshot сокращает линейку. Старая серия moonshot-v1 и ранние K2.x закрыты для новых пользователей, полное отключение платформы объявлено на конец августа 2026 года. Moonshot переводит всех на K3.
Миграция с K2.x: практический список
Если вы используете K2.6 или K2.7-Code, изменений немного, но они обязательны:
- Замените ID модели на
kimi-k3; API остается совместимым с OpenAI. - Замените
thinkingполем верхнего уровняreasoning_effort. Объект K2thinkingне является параметром K3 и вызывает ошибку. - Удалите параметры сэмплинга K3. Уберите
temperature,top_pи штрафы: сервер фиксирует их и отклоняет другие значения. - Выбирайте усилие заранее.
max— самый дорогой уровень по умолчанию, tokens рассуждения оплачиваются как выход. Для простых задач используйтеhighилиlowи не меняйте их в диалоге, чтобы не сбросить кэш. - Пересчитайте расходы. Выход по прайсу стоит 3.75x тарифа K2.6, а постоянное рассуждение увеличивает объем. Используйте кэш: стабильный префикс впереди, переменный суффикс в конце.
- Переделайте ввод изображений, если использовали публичные URL. K3 принимает только base64 или ссылки на загруженные файлы[5].
- Возвращайте сообщения assistant целиком, включая
reasoning_contentиtool_calls, в каждом ходе.
Кому стоит использовать K3 сейчас
По подтвержденным данным K3 подходит для долгих задач, где качество важнее цены token: многочасовых кодинг-агентов в больших репозиториях, корпусов на миллион tokens с повторными запросами к кэшированному префиксу и мультимодального рассуждения с изображениями, видео и кодом в одном контексте.
Она не подходит интерактивным продуктам с низкой задержкой — 28 tokens/sec решают другую задачу, — процессам с настраиваемым сэмплингом и чистой оптимизации затрат. Для последней есть дешевые уровни.
Запуск Kimi K3 через reAPI
K3 доступна в шлюзе reAPI как OpenAI-совместимый endpoint: замените base URL на https://api.reapi.ai/v1, отправьте ключ как bearer token и задайте kimi-k3. Существующий SDK openai работает без изменений.
curl https://api.reapi.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "Refactor this module and add tests." }
],
"reasoning_effort": "high",
"stream": true
}'Есть две причины использовать K3 через reAPI вместо прямого доступа:
- Цена. reAPI берет за K3 $2.50 за вход / $12.00 за выход на 1M tokens, ниже Moonshot по обеим позициям, а выход дешевле на одну пятую[8]. Для модели, где рассуждение увеличивает выход, эта ставка важнее всего.
- Один ключ, много моделей. Ключ дает доступ к Claude, GPT, Gemini, DeepSeek, GLM и Kimi. K3 становится вариантом маршрутизации, а не привязкой к поставщику, и входит в общую логику fallback и балансировки.
Полная поверхность — фиксированные параметры, кэш, формат vision и ошибки — описана в документации Kimi K3, текущие цены находятся на странице модели.
Частые вопросы
Kimi K3 имеет открытый исходный код?
Moonshot называет K3 open-source выпуском и обещает веса, что сделает ее первой открытой моделью класса 3 триллионов параметров[3]. Публикация ожидается скоро, но основной доступ пока идет через API.
Можно ли отключить или уменьшить рассуждение K3?
Отключить нельзя. Уменьшить можно: reasoning_effort принимает low, high, max, по умолчанию max[4]. low нужен, когда рассуждение стоит дороже ценности ответа.
Контекст 1M стоит дороже?
Нет. Цена token едина при любой длине: prompt на 900K tokens имеет ту же ставку, что на 9K[2]. Напрямую в Moonshot вход с кэшем стоит $0.30 за 1M tokens.
Почему K3 возвращает ошибку temperature?
temperature, top_p, n и оба штрафа фиксированы на сервере; другое значение вызывает ошибку, а не заменяет настройку[1]. Удалите их. То же относится к thinking K2: используйте верхнеуровневый reasoning_effort.
Можно ли использовать K3 в Claude Code, Codex или Cline?
Да. API совместим с OpenAI, поэтому работает любой инструмент с собственными base URL и ключом, включая Claude Code, Codex, Cline, RooCode и OpenCode. Укажите https://api.reapi.ai/v1, ключ и ID kimi-k3.
Как K3 сравнивается с Claude Opus 4.8 и GPT-5.5 в бенчмарках?
Moonshot пока не опубликовала официальную таблицу K3: ни SWE-Bench, ни Terminal-Bench, ни независимо проверяемых результатов. Считайте цифры из соцсетей неподтвержденными до выхода таблицы и технического отчета.
Источники
- Moonshot AI. Быстрый старт Kimi K3: ID, фиксированный сэмплинг, лимиты, инструменты и кэш. Получено в июле 2026 года с platform.kimi.ai/docs/guide/kimi-k3-quickstart
- Moonshot AI. Цена Kimi K3: $3.00 / $15.00 за 1M tokens, кэш $0.30, без уровней контекста. Получено в июле 2026 года с platform.kimi.ai/docs/pricing/chat-k3
- Moonshot AI. Модели: 2.8T, Kimi Delta Attention + Attention Residuals, Stable LatentMoE (16 из 896), обязательство открыть веса. Получено в июле 2026 года с platform.kimi.ai/docs/api/models-overview
- Moonshot AI. reasoning_effort: low / high / max, max по умолчанию, сброс кэша при смене. Получено в июле 2026 года с platform.kimi.ai/docs/guide/use-reasoning-effort
- Moonshot AI. Зрение Kimi: изображения и видео, base64 и файлы, без публичных URL. Получено в июле 2026 года с platform.kimi.ai/docs/guide/use-kimi-vision-model
- Moonshot AI. Kimi Linear: An Expressive, Efficient Attention Architecture (arXiv:2510.26692): KDA, схема 3:1, KV-cache и декодирование. Получено в июле 2026 года с arxiv.org/abs/2510.26692
- OpenRouter. MoonshotAI: Kimi K3 — кэш, средняя цена, скорость и TTFT. Получено в июле 2026 года с openrouter.ai/moonshotai/kimi-k3
- reAPI. Kimi K3 — страница модели, документация и цены. Получено в июле 2026 года с reapi.ai/docs/kimi-k3
- Moonshot AI. Chat Completions API — output cap and input-plus-cap validation. Retrieved September 8, 2026 from platform.kimi.ai/docs/api/chat
Дополнительные материалы
- reAPI. Документация API Kimi K3. reapi.ai/docs/kimi-k3
- reAPI. Страница Kimi K3 — текущие цены. reapi.ai/models/kimi-k3
- reAPI. Что такое Claude Opus 4.8? Новая модель Anthropic. reapi.ai/blog/what-is-claude-opus-4-8
- reAPI. Что такое reAPI? reapi.ai/blog/what-is-reapi
Автор

Категории
Ещё статьи

Gemini Omni против Seedance 2.0: сравнение видеомоделей 2026 года
Gemini Omni и Seedance 2.0 в мае 2026 года: новинка Google I/O против лидера Arena #1. Сравниваем функции, мультикадры, звук и цены.


Самый дешевый Veo 3.1 API в 2026 году: реальные цены
Veo 3.1 стоит от $0.40/sec у Google до $0.046 за 8-секундный ролик в reAPI. Сравнение пяти провайдеров на май 2026 года.


AI видео 30 секунд: цепь за лимит
AI видео максимум 30 секунд. Длинные видео цепочкой: параметры, видимые швы, качество соединений. Стоимость трёхминутного видео. Полное руководство.
