Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
MiniMax M3: контекст 1M, цена и кодирование (2026)
2026/08/01

MiniMax M3: контекст 1M, цена и кодирование (2026)

API MiniMax M3 для кодирования и агентов с контекстом 1M токенов. Официальная цена и reAPI, режимы рассуждений, мультимодальный вход и ограничения.

API MiniMax M3 создан для кодирующих агентов, долгосрочных рабочих процессов с инструментами и мультимодального анализа. Он принимает текст, изображения и видео, поддерживает до одного миллиона токенов контекста и предоставляет элементы управления мышлением для торговли задержкой против более глубокого рассуждения. Открытые веса также доступны, но размещённый API — практический маршрут для команд, которые не хотят работать с контрольной точкой класса 800GB.

В этом руководстве различаются поведение прямого API MiniMax и текущий маршрут reAPI. Это различие имеет значение, потому что ID модели, полосы цен и поверхности запроса не идентичны.

TL;DR

  • MiniMax выпустил M3 1 июня 2026 года, а затем опубликовал веса модели под лицензией MiniMax Community License.[1]
  • Размещённая модель поддерживает до 1M токенов с нативным входом текста, изображения и видео.[2]
  • MiniMax цены прямые вызовы API по-разному ниже и выше 512K входящих токенов.
  • reAPI в настоящий момент использует одну плоскую ставку: $0.60 входящих, $2.40 выходящих и $0.12 чтения кэша за миллион токенов.
  • Используй M3 для анализа хранилища, кодирующих агентов, работы с большим количеством документов и мультимодальных задач. Не предполагай, что окно 1M делает извлечение, компактность или организацию подсказки ненужными.

Спецификации MiniMax M3 API

СпецификацияMiniMax M3
Дата выпуска1 июня 2026 года
Контекстное окноДо 1M токенов
Гарантированный размещённый контекстМинимум 512K токенов
Модальности входаТекст, изображение, видео
ВыходТекст
Режимы рассужденийВключено, адаптивно, отключено
Рекомендуемая выборкаtemperature: 1.0, top_p: 0.95
ID модели reAPIminimax/minimax-m3
Конечная точка reAPI/v1/chat/completions
ВесаОпубликовано на Hugging Face и GitHub

MiniMax описывает M3 как кодирующую и агентскую модель, основанную на MiniMax Sparse Attention. Архитектура разработана для снижения затрат вычисления и памяти на миллион-токен внимание. Это претензия поставщика об его архитектуре, а не гарантия того, что каждый запрос с миллионом токенов будет быстрым или одинаково точным по всей последовательности.

Опубликованная контрольная точка составляет примерно 427 миллиардов параметров, и основной репозиторий Hugging Face имеет размер примерно 854GB перед локальными накладными расходами на обслуживание. Локальное развёртывание возможно через такие фреймворки как SGLang, vLLM, Transformers и KTransformers, но это не небрежная однографическая модель.[1]

Цена API MiniMax M3 объяснена

Прямой API MiniMax разделяет обычные и долгоконтекстные вызовы. Его текущая прейскурантная ставка отображает следующие стандартные сервисные цены:

МаршрутВходящие / 1MВыходящие / 1MЧтение кэша / 1M
MiniMax прямо, входящие ≤512K$0.30$1.20$0.06
MiniMax прямо, входящие 512K–1M$0.60$2.40$0.12
Текущая ставка reAPI$0.60$2.40$0.12

Приведённые выше прямые цены — это дисконтные ставки, отображаемые MiniMax 1 августа 2026 года. Страница также отображает более высокие перечёркнутые прейскурантные цены, поэтому бюджеты производства должны хранить дату получения, а не рассматривать скидку как постоянное свойство модели.[3]

reAPI использует плоскую ставку токена вместо изменения цены на границе 512K. Это легче оценить, хотя вызовы коротого контекста могут быть дешевле через прямой прейскурантный уровень MiniMax.

Карта контекста и цены MiniMax M3, показывающая границу 512K, окно 1M и текущую плоскую ставку reAPI

Реалистичный пример стоимости

Предположим, работа анализа хранилища отправляет 180 000 некэшированных входящих токенов и возвращает 12 000 выходящих токенов через reAPI:

входящие  = 180 000 / 1 000 000 × $0.60 = $0.1080
выходящие =  12 000 / 1 000 000 × $2.40 = $0.0288
всего  = $0.1368

Тот же рабочий процесс становится дешевле при повторяющихся префиксах, попадающих в кэш. Поместите стабильные определения инструментов, инструкции хранилища и системный контекст в первый; держите изменяющиеся детали задач рядом с концом. MiniMax говорит, что автоматическое кэширование подсказок использует сопоставление префиксов и применяется к входам минимум 512 токенов.[4]

Как вызвать MiniMax M3 через reAPI

Маршрут reAPI использует знакомую форму OpenAI Chat Completions. Важная деталь — это пространственный ID модели.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax/minimax-m3",
    "messages": [
      {
        "role": "system",
        "content": "Review code conservatively. State assumptions before editing."
      },
      {
        "role": "user",
        "content": "Find the race condition in this queue worker and propose a minimal patch."
      }
    ],
    "temperature": 1,
    "top_p": 0.95,
    "max_tokens": 8192
  }'

Используй точный ID, возвращённый обнаружением модели при интеграции с производственным ключом. Страница модели MiniMax M3 и документация API показывают текущую поверхность reAPI.

Прямая конечная точка MiniMax использует MiniMax-M3 вместо пространственного ID reAPI. Не копируй строку модели одного поставщика в запрос другого поставщика и не предполагай, что шлюз её нормализует.

Режимы мышления и поведение агента

Карточка открытой модели документирует три режима рассуждения:

  • enabled: всегда использовать явное рассуждение.
  • adaptive: позволить M3 решать, когда полезно дополнительное рассуждение.
  • disabled: минимизировать задержку и максимизировать пропускную способность.

Для проверки кода, отладки, многошагового планирования и инструментально-интенсивных агентов начни с адаптивного или включённого рассуждения. Для автодополнения, классификации и коротких трансформаций отключённое рассуждение может уменьшить задержку. MiniMax говорит, что мышление включено и выключено имеют одинаковые прямые цены API токена; разница в стоимости исходит из того, сколько токенов окончательно потребляет запрос, а не отдельного сбора рассуждений.[2]

Элементы управления рассуждениями могут отличаться по маршрутам размещения. Если приложение зависит от конкретного поля thinking, проверьте принимаемую схему запроса перед отправкой, а не предполагайте, что все конечные точки, совместимые с OpenAI, её пересылают.

Где помогает контекстное окно в один миллион токенов

Большое контекстное окно наиболее полезно, когда модели нужно несколько связанных артефактов одновременно:

  • хранилище плюс история проблем и логи сборки;
  • большой набор контрактов с кросс-документальными ссылками;
  • транскрипция видео в паре с выбранными кадрами;
  • многошаговые следы агента, которые должны оставаться доступными для позднейших решений.

Менее полезно, когда подсказка — это нефильтрованная свалка. Большие входы увеличивают задержку и могут похоронить релевантные доказательства. Производственный агент всё ещё должен дедублировать файлы, сначала получить вероятные разделы, резюмировать завершённые следы инструментов и сохранять точные расположения источников для проверки.

Если твоё решение в основном о открытых весах и управляемой надёжности, сравни Kimi K3 с Claude Opus 5. Для другой модели кодирования с низкой стоимостью, поддерживающей один миллион токенов, смотри руководство API GLM-5.2.

Ограничения MiniMax M3

Главное ограничение — масштаб операций. Публикация весов даёт командам контроль развёртывания, но это не делает 427B-параметрическую мультимодальную модель легкой для обслуживания. Квантизация снижает память, в то время как долгие контексты добавляют KV-кэш и нагрузку пропускной способности обратно в систему.

Претензии на бенчмарк также нуждаются в контексте. MiniMax сообщает 59.0% на SWE-Bench Pro и 66.0% на Terminal-Bench 2.1, но примечания выпуска объясняют, что различные модели иногда использовали различные строительные леса и что несколько результатов пришли из внутренней инфраструктуры.[2] Рассматривай те баллы как доказательство предполагаемой способности, а не прогноз успеха в твоём собственном агенте.

Наконец, доступность один-миллион-токенов может зависеть от ёмкости сервиса. MiniMax описывает 512K как гарантированное и верхний диапазон как до 1M. Протестируй точный регион, учётную запись, параллелизм и размер запроса, который ты планируешь использовать.

FAQ

Является ли MiniMax M3 открытым весом?

Да. MiniMax публикует веса M3 на Hugging Face и код на GitHub под лицензией MiniMax Community License. Проверьте эту лицензию перед коммерческим развёртыванием.

Каково контекстное окно MiniMax M3 API?

Размещённый API поддерживает до одного миллиона токенов, при этом MiniMax описывает 512K как гарантированный минимум. Вызовы выше 512K используют более высокую прямую полосу цен.

Поддерживает ли MiniMax M3 изображения и видео?

Да. MiniMax описывает M3 как нативно мультимодальный с входом текста, изображения и видео. Его выход — текст, а не генерируемые изображения или видео.

Какой ID модели использует reAPI?

Используй minimax/minimax-m3 с https://api.reapi.ai/v1/chat/completions.

Дешевле ли MiniMax M3, чем GPT или Claude?

Его ставки токена ниже, чем во многих передовых управляемых моделях, но стоимость за токен — это не стоимость за завершённую задачу. Сравни надёжность инструментов, повторные попытки, длину выхода, задержку и усилие проверки на твоей собственной нагрузке.

Заключение

API MiniMax M3 — отличный выбор для команд, которым нужен долгий контекст, кодирующие агенты, мультимодальный вход и возможность самостоятельного хостинга позже. Сначала используй маршрут размещения, когда ты хочешь предсказуемые операции; оценивай открытые веса, когда контроль данных или настройка оправдывают инфраструктуру. Самое важное — бюджет правильной полосы контекста и протестируй хорошо сформированный агент, а не только имя модели.

References

  1. MiniMax AI. MiniMax M3 official model repository and local deployment guidance. huggingface.co/MiniMaxAI/MiniMax-M3
  2. MiniMax. MiniMax M3: Frontier Coding, 1M Context, Native Multimodality. minimax.io/blog/minimax-m3
  3. MiniMax API Platform. MiniMax M3 pay-as-you-go pricing. platform.minimax.io
  4. MiniMax API Docs. Automatic prompt caching. platform.minimax.io/docs/api-reference/text-prompt-caching