MiniMax Speech — это линейка text-to-speech (T2A) моделей MiniMax: актуальный флагман speech-2.8-hd / speech-2.8-turbo, плюс 2.6 и legacy speech-02. Ниже — как пользоваться MiniMax Speech новичку: синхронный и длинный TTS, клонирование голоса, цены PayGO в USD и отличие от MiniMax Music и MiniMax H3 (видео).
Соседи по звуку: Suno, Udio, Mubert. Креатив-pillar — Midjourney.
Что умеет Speech 2.8
- Синхронный T2A — до 10 000 символов за запрос; HTTP или WebSocket; форматы mp3/pcm/flac/wav; streaming.
- Асинхронный long-text — до 1M символов; задача → task_id → файл; URL результата живёт 9 часов.
- Голоса — 300+ системных в sync API; клонирование и Voice Design (описание голоса текстом).
- Языки — дока заявляет 40 языков (в т.ч. русский, английский, китайский и др.).
- Параметры — громкость, pitch, скорость, микс; у HD — sound tags (формулировка overview).
Ожидание новичка: 2-3 озвучки короткого скрипта (ролик / демо бота), а не «аудиокнига за вечер» на первом заходе.
Модели и цены T2A (Pay as You Go)
| API / модель | Роль | Цена PayGO* |
|---|---|---|
| speech-2.8-turbo | Актуальный Turbo: скорость и естественный поток | $60 / 1M characters |
| speech-2.8-hd | Актуальный HD: качество + sound tags | $100 / 1M characters |
| speech-2.6-turbo / speech-02-turbo | Предыдущие Turbo (в т.ч. 40 языков у 2.6-turbo) | $60 / 1M characters |
| speech-2.6-hd / speech-02-hd | Предыдущие HD | $100 / 1M characters |
| Rapid Voice Cloning | Клон с референс-аудио | $1.5 / voice |
| Voice Design | Голос из текстового описания | $3 / voice |
*Источник: platform.minimax.io/docs/guides/pricing-paygo (блок Audio) и api-overview (Text to Speech). Срез: август 2026. Отдельно есть Audio Subscription ($5…$999/мес и пакеты points) на pricing-speech — это не то же самое, что PayGO API Key. Рублёвых тарифов на странице нет — не выдумываем ₽.
Speech ≠ Music ≠ H3
| Продукт | Модальность | Типичный вход | Гайд |
|---|---|---|---|
| MiniMax Speech | Голос / TTS | Текст (+ опционально клон голоса) | эта статья |
| MiniMax Music | Музыка | Промпт стиля + lyrics | Music 3.0 |
| MiniMax H3 | Видео | Текст / картинка / референс | H3 |
Маршрут: первая озвучка за 20 минут
- Аккаунт на platform.minimax.io → API Key (Pay as You Go) или Audio Subscription Key — это разные ключи по доке.
- Короткий скрипт 300-800 символов: один спикер, одна сцена, без «романа».
- Модель: начните с
speech-2.8-turbo; HD — когда слышите артефакты или нужны sound tags. - Голос: системный из каталога → если нужен свой тембр, Rapid Voice Cloning (плата за voice по прайсу; голос временный, закрепить через T2A в 168 часов).
- Скачайте результат сразу; для async long-text URL живёт 9 часов.
- Права: клон чужого голоса без согласия — юридический и этический риск; не делайте «для прикола».
Скрипт (пример):
«Привет! Это демо озвучки для короткого ролика.
Сейчас одна мысль - без воды - и чёткий призыв в конце.»
Типичные ошибки
- Путать Speech с Music (песня) и H3 (видео) в одном API-ключе «на всё сразу» без чтения overview.
- Гнать HD на каждый черновик — $100/M против $60/M у Turbo.
- Клонировать голос и не закрепить синтезом за 7 дней — голос удалится (формулировка Voice Cloning notes).
- Кидать в sync API роман на 50k символов — лимит sync 10k; для длинного текста — async.
FAQ: MiniMax Speech
Что такое MiniMax Speech?
Text-to-speech API и аудио-продукты MiniMax: модели speech-2.8 / 2.6 / speech-02, клонирование и voice design.
С чего начать новичку?
Короткий скрипт + speech-2.8-turbo на platform.minimax.io. HD и клон — после 2-3 удачных черновиков.
Сколько стоит озвучка?
PayGO: Turbo $60/M characters, HD $100/M; клон $1.5/voice, design $3/voice (pricing-paygo, август 2026). Подписка Audio — отдельная сетка на pricing-speech.
Чем Speech отличается от MiniMax Music?
Speech читает текст голосом. Music генерирует трек по стилю и lyrics. Разные модели и строки прайса.
Сколько языков поддерживается?
В api-overview для speech synthesis заявлено 40 языков, включая русский.
Голос после клонирования вечный?
Нет: по доке временный; нужно использовать в T2A в течение 168 часов (7 дней), иначе удалится. Preview внутри cloning API не считается закреплением.
Вывод
MiniMax Speech — голос и TTS, не музыка и не видео. Старт: Turbo + короткий скрипт; HD и клон — по факту качества. Когда нужна система обучения креативу — форматы на странице обучения.
Хотите нейросети под свои задачи, а не «для всех»?
Когда базовых гайдов уже мало, помогает разбор под вашу работу. Наставничество, курсы и подписка Артёма Денисова — все форматы на странице обучения. Старт-карта — «Нейросети для начинающих».