Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Kimi K3: полный обзор флагманской модели Moonshot на 2.8T
2026/07/27 ·

Kimi K3: полный обзор флагманской модели Moonshot на 2.8T

Kimi K3: архитектура, цены и API с контекстом 1M, постоянным рассуждением, фиксированным сэмплингом и совместимостью с OpenAI.

Moonshot AI выпустила Kimi K3 в середине июля 2026 года, но сделала это в обратном порядке: документация API, страница цен и рабочий ID модели kimi-k3 появились раньше таблицы бенчмарков, технической статьи и весов[1]. Информационный вакуум на неделю заполнили обсуждения утечек, и почти в каждой версии хотя бы один параметр был указан неверно. Это руководство опирается на собственную документацию Moonshot и разделяет подтвержденные сведения, намеренно фиксированные настройки и еще не опубликованные данные.

У нас также есть конкретная точка зрения: Kimi K3 работает через шлюз reAPI. Поэтому ниже разобрана не только сама модель, но и ее реальные вызовы — параметры, из-за которых запрос отклонят, влияние кэша на счет и ловушки миграции кода K2.x.

Кратко

  • Kimi K3 — флагман на 2.8 триллиона параметров, построенный на гибридном механизме линейного внимания Kimi Delta Attention и Attention Residuals. Stable LatentMoE активирует 16 из 896 экспертов на token[1][3].
  • Окно контекста составляет 1 048 576 tokens с единым тарифом, без надбавки за длинный контекст. В нативном API Moonshot лимит вывода по умолчанию равен 131 072 и может достигать 1 048 576, если сумма входа и лимита помещается в окно[1][2][9].
  • Рассуждение включено всегда. Единственная настройка — трехуровневый reasoning_effort (low / high / max, без medium), по умолчанию max[4].
  • Сэмплинг заблокирован: temperature 1.0, top_p 0.95, n 1, оба штрафа 0. Другое значение возвращает ошибку[1].
  • Опубликованный тариф Moonshot — $3.00 за вход / $15.00 за выход на 1M tokens ($0.30 за вход при попадании в кэш). В reAPI та же модель стоит $2.50 / $12.00, дешевле по обеим позициям[2][8].
  • Изображения и видео принимаются нативно, но публичные URL изображений отклоняются. Нужен base64 или ссылка на загруженный файл[5].

Kimi K3 в цифрах

Все сведения в таблице взяты из документации Moonshot API, полученной 26 июля 2026 года:

ХарактеристикаKimi K3 (официально)
ID моделиkimi-k3
Всего параметров2.8 триллиона
АрхитектураKimi Delta Attention (гибридное линейное внимание) + Attention Residuals; Stable LatentMoE, активны 16 из 896 экспертов
Окно контекста1,048,576 tokens (1M)
Максимальный выводНативное значение по умолчанию 131 072 tokens; предел параметра 1 048 576, если вход и лимит вместе помещаются в контекст [9]
Модальноститекст, изображение и видео на входе; текст на выходе
Рассуждениевсегда включено; reasoning_effort со значениями low / high / max, по умолчанию max
Цена входа (без кэша)$3.00 за 1M tokens
Цена входа (с кэшем)$0.30 за 1M tokens
Цена выхода$15.00 за 1M tokens
Уровни контекстанет — единый тариф за token при любой длине

Две цифры требуют внимания. Размер 2.8T выводит K3 в класс, где еще не было моделей с открытыми весами. Moonshot обещала опубликовать веса, что сделает ее первой open-source моделью класса 3 триллионов[3]. Вторая цифра — цена. При $3.00 / $15.00 K3 стоит в три-четыре раза дороже линейки K2. Moonshot оценивает ее как передовой флагман, а не как бюджетную модель, с которой раньше ассоциировалась Kimi, но все же дешевле закрытых передовых моделей и на входе, и на выходе.

Запуск: сначала API, затем доказательства

Порядок запуска объясняет противоречивые сведения. До релиза наблюдатели заметили промостраницу на платформе Moonshot и beta-переключатели в приложении Kimi. Утечки сошлись на «примерно 2.5T параметров и контекст 1M». Близко, но официальная цифра — 2.8T. Затем официальный аккаунт Moonshot показал ролик без текста, а продукт опередил прессу: документация API, быстрый старт и цены вышли в тот же день, что и первые финансовые публикации о запуске[1][2].

Такая последовательность — API и документация до бенчмарков и весов — противоположна запуску флагманов K2, которые получали техническую статью и открытые веса в первый день. Поэтому первую неделю жизни K3 документация была единственным надежным источником, а остальное оставалось предположениями.

Архитектура: Kimi Delta Attention, LatentMoE, Attention Residuals

Самая интересная техническая строка сообщает, что K3 «построена на Kimi Delta Attention, гибридном механизме линейного внимания, и Attention Residuals»[3]. Это не маркетинг, а промышленное применение исследования Kimi Linear, опубликованного Moonshot в конце 2025 года. Оно объясняет и окно 1M tokens, и единый тариф, делающий его практичным[6].

Kimi Delta Attention (KDA) — механизм линейного внимания, развитие Gated DeltaNet с более точным гейтингом. Кэш ключей и значений стандартного softmax-внимания растет линейно с последовательностью, поэтому контекст в миллион tokens крайне дорог. Линейное внимание хранит рекуррентное состояние фиксированного размера. Исторически платой было качество: чистое линейное внимание хуже вспоминает точные детали длинных документов.

Гибридная схема решает компромисс в статье Kimi Linear: слои KDA чередуются с полным вниманием в пропорции 3:1. Три слоя из четырех используют дешевый линейный механизм, четвертый сохраняет точное глобальное внимание. В опубликованных результатах схема превзошла полное внимание по качеству, сократила память KV-cache до 75% и ускорила декодирование до 6x в контексте 1M tokens[6].

Stable LatentMoE — разреженная mixture-of-experts: 896 экспертов, 16 активны для каждого token[3]. Разреженность позволяет обслуживать модель 2.8T: активные вычисления используют лишь малую часть всех параметров.

Attention Residuals — единственный компонент без опубликованной статьи; термин впервые появился в документации K3. Пока нет технического отчета, мы знаем название, но не механизм.

Практический смысл в том, что окно 1M tokens полезно только при приемлемой цене. Большинство провайдеров длинного контекста повышают тариф или незаметно снижают качество. У K3 уровней нет: 5,000 и 900,000 tokens оплачиваются по одной ставке[2]. Это разумно, только если предельная стоимость длинного контекста действительно упала, для чего и создан KDA. Архитектура объясняет цену.

Что на самом деле поставляет API

API K3 задает жесткие правила, способные удивить команды после K2.x или OpenAI-подобных моделей. Это документированные ограничения, не наблюдения[1]:

  • Рассуждение всегда включено. Режима без мышления нет. FAQ Moonshot прямо отвечает на вопрос об отключении цепочки рассуждений: никак. Поле верхнего уровня reasoning_effort принимает low, high и max. medium отсутствует, а самый дорогой max задан по умолчанию[4].
  • Сэмплинг фиксирован. temperature равна 1.0, top_p 0.95, n 1, оба штрафа 0. Иные значения вызывают ошибку, поэтому поля нужно убрать. Если процесс менял temperature по задаче, такого рычага больше нет.
  • Бюджет вывода должен помещаться в окно вместе со входом. В нативном API Moonshot max_completion_tokens по умолчанию равен 131 072 и может достигать 1 048 576. Если сумма входа и лимита превышает контекст, API возвращает invalid_request_error. Максимальное значение параметра не гарантирует итоговый ответ на миллион tokens. Задавайте лимит явно, оставляя место для входа, рассуждений и ответа[9].
  • Стриминг разделяет рассуждение и ответ. Ответ передает delta reasoning_content отдельно от delta content, позволяя интерфейсу раздельно показывать ход мысли и итог.
  • Preserved Thinking обязателен. В многоходовых и инструментальных циклах полное сообщение assistant, включая reasoning_content и tool_calls, нужно без изменений возвращать в messages. Сохранение только content, привычное для OpenAI-подобного кода, незаметно ухудшает модель.
  • У зрения есть строгие ограничения. Изображения и видео нативны, но публичные URL изображений не принимаются. Используйте URI base64 или загрузите файл и передайте его ID[5].
  • Структурированный вывод — штатная функция. JSON Schema с strict: true ограничивает итоговый ответ, но не рассуждение в прозе.

Новый стек вызова инструментов

В K3 дебютируют две функции. Обе решают одну проблему: агенты с множеством инструментов тратят контекст на их определения[1].

tool_choice: "required" требует хотя бы один вызов инструмента за ход. Агент не ответит по памяти, когда обязан выполнить поиск. K2 отклоняет это значение, K3 принимает.

Динамическая загрузка инструментов работает необычнее: добавьте полное определение в сообщение system посреди диалога, с полем tools и без content. С этого момента инструмент доступен. Вместо 80 схем в начале каждого запроса оркестратор вводит нужные в конкретной фазе. Сервер не хранит такой инструмент: если убрать system-сообщение из истории, в следующем ходе он исчезнет.

Документация предупреждает: встроенный web_search Moonshot обновляется и сейчас не рекомендован для production. Для поиска подключайте собственный инструмент.

Автоматический кэш контекста

Кэш K3 не требует ID, управления TTL и параметров. Сохраняйте длинный префикс стабильным, и платформа автоматически попытается использовать кэш, выставив $0.30 вместо $3.00 за 1M tokens[1]. Скидка на повторный контекст составляет 90% и превращает окно 1M в рабочий прием: загрузите корпус стабильным префиксом и запрашивайте его за десятую часть цены.

Есть два условия. Prompt предыдущего запроса должен превышать 256 tokens; меньшее не кэшируется. Уровень reasoning_effort нельзя менять: переключение внутри диалога инвалидирует префикс[4]. Выберите уровень заранее.

Ранняя сторонняя телеметрия подтверждает механизм: статистика K3 в OpenRouter показывала более 75% попаданий, снижая среднюю взвешенную цену входа намного ниже трети прайса[7].

Цена: намеренный отказ от бюджетной стратегии

Все прежние Kimi конкурировали прежде всего стоимостью. K3 — нет. Ниже положение в семье и среди передовых моделей, за 1M tokens и без кэша на входе:

МодельВходВыходВход с кэшемКонтекст
Kimi K2.6$0.95$4.00$0.16256K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K3 (напрямую Moonshot)$3.00$15.00$0.301M
Kimi K3 в reAPI$2.50$12.001M
Claude Opus 4.8$5.00$25.001M
GPT-5.5$5.00$30.00400K

Позиция очевидна: K3 в три-четыре раза дороже родственных моделей и на 40–50% дешевле закрытых передовых. Moonshot считает, что окно 1M tokens, нативное видео и передовые возможности оправдывают премиальный уровень среди открытых весов.

Скорость — честная оговорка. Ранние измерения дают K3 около 28 tokens в секунду и четыре секунды до первого token[7]. Для постоянно рассуждающей модели такого размера ожидаемо, но медленно. K3 создана для глубины одного вызова, а не их числа в минуту; чувствительным к задержке циклам нужна другая модель.

Еще одна деталь: Moonshot сокращает линейку. Старая серия moonshot-v1 и ранние K2.x закрыты для новых пользователей, полное отключение платформы объявлено на конец августа 2026 года. Moonshot переводит всех на K3.

Миграция с K2.x: практический список

Если вы используете K2.6 или K2.7-Code, изменений немного, но они обязательны:

  1. Замените ID модели на kimi-k3; API остается совместимым с OpenAI.
  2. Замените thinking полем верхнего уровня reasoning_effort. Объект K2 thinking не является параметром K3 и вызывает ошибку.
  3. Удалите параметры сэмплинга K3. Уберите temperature, top_p и штрафы: сервер фиксирует их и отклоняет другие значения.
  4. Выбирайте усилие заранее. max — самый дорогой уровень по умолчанию, tokens рассуждения оплачиваются как выход. Для простых задач используйте high или low и не меняйте их в диалоге, чтобы не сбросить кэш.
  5. Пересчитайте расходы. Выход по прайсу стоит 3.75x тарифа K2.6, а постоянное рассуждение увеличивает объем. Используйте кэш: стабильный префикс впереди, переменный суффикс в конце.
  6. Переделайте ввод изображений, если использовали публичные URL. K3 принимает только base64 или ссылки на загруженные файлы[5].
  7. Возвращайте сообщения assistant целиком, включая reasoning_content и tool_calls, в каждом ходе.

Кому стоит использовать K3 сейчас

По подтвержденным данным K3 подходит для долгих задач, где качество важнее цены token: многочасовых кодинг-агентов в больших репозиториях, корпусов на миллион tokens с повторными запросами к кэшированному префиксу и мультимодального рассуждения с изображениями, видео и кодом в одном контексте.

Она не подходит интерактивным продуктам с низкой задержкой — 28 tokens/sec решают другую задачу, — процессам с настраиваемым сэмплингом и чистой оптимизации затрат. Для последней есть дешевые уровни.

Запуск Kimi K3 через reAPI

K3 доступна в шлюзе reAPI как OpenAI-совместимый endpoint: замените base URL на https://api.reapi.ai/v1, отправьте ключ как bearer token и задайте kimi-k3. Существующий SDK openai работает без изменений.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "Refactor this module and add tests." }
    ],
    "reasoning_effort": "high",
    "stream": true
  }'

Есть две причины использовать K3 через reAPI вместо прямого доступа:

  • Цена. reAPI берет за K3 $2.50 за вход / $12.00 за выход на 1M tokens, ниже Moonshot по обеим позициям, а выход дешевле на одну пятую[8]. Для модели, где рассуждение увеличивает выход, эта ставка важнее всего.
  • Один ключ, много моделей. Ключ дает доступ к Claude, GPT, Gemini, DeepSeek, GLM и Kimi. K3 становится вариантом маршрутизации, а не привязкой к поставщику, и входит в общую логику fallback и балансировки.

Полная поверхность — фиксированные параметры, кэш, формат vision и ошибки — описана в документации Kimi K3, текущие цены находятся на странице модели.

Частые вопросы

Kimi K3 имеет открытый исходный код?

Moonshot называет K3 open-source выпуском и обещает веса, что сделает ее первой открытой моделью класса 3 триллионов параметров[3]. Публикация ожидается скоро, но основной доступ пока идет через API.

Можно ли отключить или уменьшить рассуждение K3?

Отключить нельзя. Уменьшить можно: reasoning_effort принимает low, high, max, по умолчанию max[4]. low нужен, когда рассуждение стоит дороже ценности ответа.

Контекст 1M стоит дороже?

Нет. Цена token едина при любой длине: prompt на 900K tokens имеет ту же ставку, что на 9K[2]. Напрямую в Moonshot вход с кэшем стоит $0.30 за 1M tokens.

Почему K3 возвращает ошибку temperature?

temperature, top_p, n и оба штрафа фиксированы на сервере; другое значение вызывает ошибку, а не заменяет настройку[1]. Удалите их. То же относится к thinking K2: используйте верхнеуровневый reasoning_effort.

Можно ли использовать K3 в Claude Code, Codex или Cline?

Да. API совместим с OpenAI, поэтому работает любой инструмент с собственными base URL и ключом, включая Claude Code, Codex, Cline, RooCode и OpenCode. Укажите https://api.reapi.ai/v1, ключ и ID kimi-k3.

Как K3 сравнивается с Claude Opus 4.8 и GPT-5.5 в бенчмарках?

Moonshot пока не опубликовала официальную таблицу K3: ни SWE-Bench, ни Terminal-Bench, ни независимо проверяемых результатов. Считайте цифры из соцсетей неподтвержденными до выхода таблицы и технического отчета.

Источники

  1. Moonshot AI. Быстрый старт Kimi K3: ID, фиксированный сэмплинг, лимиты, инструменты и кэш. Получено в июле 2026 года с platform.kimi.ai/docs/guide/kimi-k3-quickstart
  2. Moonshot AI. Цена Kimi K3: $3.00 / $15.00 за 1M tokens, кэш $0.30, без уровней контекста. Получено в июле 2026 года с platform.kimi.ai/docs/pricing/chat-k3
  3. Moonshot AI. Модели: 2.8T, Kimi Delta Attention + Attention Residuals, Stable LatentMoE (16 из 896), обязательство открыть веса. Получено в июле 2026 года с platform.kimi.ai/docs/api/models-overview
  4. Moonshot AI. reasoning_effort: low / high / max, max по умолчанию, сброс кэша при смене. Получено в июле 2026 года с platform.kimi.ai/docs/guide/use-reasoning-effort
  5. Moonshot AI. Зрение Kimi: изображения и видео, base64 и файлы, без публичных URL. Получено в июле 2026 года с platform.kimi.ai/docs/guide/use-kimi-vision-model
  6. Moonshot AI. Kimi Linear: An Expressive, Efficient Attention Architecture (arXiv:2510.26692): KDA, схема 3:1, KV-cache и декодирование. Получено в июле 2026 года с arxiv.org/abs/2510.26692
  7. OpenRouter. MoonshotAI: Kimi K3 — кэш, средняя цена, скорость и TTFT. Получено в июле 2026 года с openrouter.ai/moonshotai/kimi-k3
  8. reAPI. Kimi K3 — страница модели, документация и цены. Получено в июле 2026 года с reapi.ai/docs/kimi-k3
  9. Moonshot AI. Chat Completions API — output cap and input-plus-cap validation. Retrieved September 8, 2026 from platform.kimi.ai/docs/api/chat

Дополнительные материалы