MiniMax Speech — это линейка text-to-speech (T2A) моделей MiniMax: актуальный флагман speech-2.8-hd / speech-2.8-turbo, плюс 2.6 и legacy speech-02. Ниже — как пользоваться MiniMax Speech новичку: синхронный и длинный TTS, клонирование голоса, цены PayGO в USD и отличие от MiniMax Music и MiniMax H3 (видео).

Соседи по звуку: Suno, Udio, Mubert. Креатив-pillar — Midjourney.

Что умеет Speech 2.8

  1. Синхронный T2A — до 10 000 символов за запрос; HTTP или WebSocket; форматы mp3/pcm/flac/wav; streaming.
  2. Асинхронный long-text — до 1M символов; задача → task_id → файл; URL результата живёт 9 часов.
  3. Голоса — 300+ системных в sync API; клонирование и Voice Design (описание голоса текстом).
  4. Языки — дока заявляет 40 языков (в т.ч. русский, английский, китайский и др.).
  5. Параметры — громкость, pitch, скорость, микс; у HD — sound tags (формулировка overview).

Ожидание новичка: 2-3 озвучки короткого скрипта (ролик / демо бота), а не «аудиокнига за вечер» на первом заходе.

Модели и цены T2A (Pay as You Go)

API / модель Роль Цена PayGO*
speech-2.8-turbo Актуальный Turbo: скорость и естественный поток $60 / 1M characters
speech-2.8-hd Актуальный HD: качество + sound tags $100 / 1M characters
speech-2.6-turbo / speech-02-turbo Предыдущие Turbo (в т.ч. 40 языков у 2.6-turbo) $60 / 1M characters
speech-2.6-hd / speech-02-hd Предыдущие HD $100 / 1M characters
Rapid Voice Cloning Клон с референс-аудио $1.5 / voice
Voice Design Голос из текстового описания $3 / voice

*Источник: platform.minimax.io/docs/guides/pricing-paygo (блок Audio) и api-overview (Text to Speech). Срез: август 2026. Отдельно есть Audio Subscription ($5…$999/мес и пакеты points) на pricing-speech — это не то же самое, что PayGO API Key. Рублёвых тарифов на странице нет — не выдумываем ₽.

Speech ≠ Music ≠ H3

Продукт Модальность Типичный вход Гайд
MiniMax Speech Голос / TTS Текст (+ опционально клон голоса) эта статья
MiniMax Music Музыка Промпт стиля + lyrics Music 3.0
MiniMax H3 Видео Текст / картинка / референс H3

Маршрут: первая озвучка за 20 минут

  1. Аккаунт на platform.minimax.io → API Key (Pay as You Go) или Audio Subscription Key — это разные ключи по доке.
  2. Короткий скрипт 300-800 символов: один спикер, одна сцена, без «романа».
  3. Модель: начните с speech-2.8-turbo; HD — когда слышите артефакты или нужны sound tags.
  4. Голос: системный из каталога → если нужен свой тембр, Rapid Voice Cloning (плата за voice по прайсу; голос временный, закрепить через T2A в 168 часов).
  5. Скачайте результат сразу; для async long-text URL живёт 9 часов.
  6. Права: клон чужого голоса без согласия — юридический и этический риск; не делайте «для прикола».
Скрипт (пример):
«Привет! Это демо озвучки для короткого ролика.
Сейчас одна мысль - без воды - и чёткий призыв в конце.»

Типичные ошибки

  • Путать Speech с Music (песня) и H3 (видео) в одном API-ключе «на всё сразу» без чтения overview.
  • Гнать HD на каждый черновик — $100/M против $60/M у Turbo.
  • Клонировать голос и не закрепить синтезом за 7 дней — голос удалится (формулировка Voice Cloning notes).
  • Кидать в sync API роман на 50k символов — лимит sync 10k; для длинного текста — async.

FAQ: MiniMax Speech

Что такое MiniMax Speech?

Text-to-speech API и аудио-продукты MiniMax: модели speech-2.8 / 2.6 / speech-02, клонирование и voice design.

С чего начать новичку?

Короткий скрипт + speech-2.8-turbo на platform.minimax.io. HD и клон — после 2-3 удачных черновиков.

Сколько стоит озвучка?

PayGO: Turbo $60/M characters, HD $100/M; клон $1.5/voice, design $3/voice (pricing-paygo, август 2026). Подписка Audio — отдельная сетка на pricing-speech.

Чем Speech отличается от MiniMax Music?

Speech читает текст голосом. Music генерирует трек по стилю и lyrics. Разные модели и строки прайса.

Сколько языков поддерживается?

В api-overview для speech synthesis заявлено 40 языков, включая русский.

Голос после клонирования вечный?

Нет: по доке временный; нужно использовать в T2A в течение 168 часов (7 дней), иначе удалится. Preview внутри cloning API не считается закреплением.

Вывод

MiniMax Speech — голос и TTS, не музыка и не видео. Старт: Turbo + короткий скрипт; HD и клон — по факту качества. Когда нужна система обучения креативу — форматы на странице обучения.

Артём Денисов эксперт Нетологии и автор курса Яндекс Практикума по промпт-инжинирингу. Отделяет Speech / Music / H3 в экосистеме MiniMax и помогает не сжечь баланс на HD-черновиках.

Хотите нейросети под свои задачи, а не «для всех»?

Когда базовых гайдов уже мало, помогает разбор под вашу работу. Наставничество, курсы и подписка Артёма Денисова — все форматы на странице обучения. Старт-карта — «Нейросети для начинающих».