MusicGen — это text-to-music модель Meta FAIR (Audiocraft): описание на английском или audio/melody prompt на входе, инструментальный WAV на выходе. Ниже — как пользоваться MusicGen новичку за один вечер через Hugging Face Demo / Transformers / локальный Audiocraft, без выдуманных подписок в рублях.
Соседи: Stable Audio, Mubert, Beatoven, Suno, Udio. Локальный стек рядом с Ollama / LM Studio. Карта новичка — нейросети для начинающих.
Что умеет MusicGen
- Text-to-music — генерация по текстовому описанию (основной сценарий README/HF).
- Melody-guided — вариант musicgen-melody: опора на мелодию/аудио-условие (см. карточку модели).
- Один проход по codebooks — EnCodec 32 kHz, 4 codebooks @ 50 Hz; без отдельного semantic LM как у MusicLM (описание статьи/карточки).
- Размеры чекпоинтов: small ~300M, medium ~1.5B, large ~3.3B параметров (+ melody).
- Лицензия весов: CC-BY-NC 4.0; код Audiocraft — MIT (карточка HF / репозиторий).
Ожидание новичка: 8-30 секунд инструментального эскиза под mood, а не готовый коммерческий хит с вокалом. В Limitations HF прямо: realistic vocals модель не генерирует; английские описания работают лучше.
Чекпоинты и точки входа
| Чекпоинт / вход | Ориентир | Для кого | На что смотреть |
|---|---|---|---|
| facebook/musicgen-small | ~300M | Быстрый тест, слабее GPU | Качество ниже large |
| facebook/musicgen-medium | ~1.5B | Баланс качества/VRAM | Нужна заметная видеопамять |
| facebook/musicgen-large | ~3.3B | Лучшее качество из релиза | Тяжелее железо |
| facebook/musicgen-melody | melody-guided | Контроль мелодии | Нужен audio/melody input |
| HF Demo / Spaces / Colab | Без локальной установки | Новичок | Очередь и лимиты демо |
| Audiocraft (GitHub) | pip + ffmpeg | Локальный пайплайн | GPU/RAM, MIT код |
Источники: huggingface.co/facebook/musicgen-small (и sibling-карточки); статья arXiv:2306.05284 «Simple and Controllable Music Generation»; github.com/facebookresearch/audiocraft. Веса CC-BY-NC 4.0 — коммерческий downstream без доп. оценки рисков в карточке помечен out-of-scope. Срез: август 2026. Цен в ₽ у open-weights нет.
Маршрут: первый трек за вечер
- Без железа: откройте Hugging Face Demo / Space для MusicGen, один английский промпт, 1-2 дубля.
- С кодом:
pip install transformers scipy→ pipelinetext-to-audioсfacebook/musicgen-small(пример в карточке HF). - Локально «по-взрослому»: Audiocraft + ffmpeg,
MusicGen.get_pretrained("small"),set_generation_params(duration=8). - Промпт: genre + instruments + mood + tempo; без запроса «спеть куплет» — вокала не будет.
- Права: CC-BY-NC на веса ≠ «можно в рекламу клиента». Для коммерческого BGM чаще смотрят SaaS с явной sync-лицензией (Mubert, Beatoven).
from transformers import pipeline
import scipy
synthesiser = pipeline("text-to-audio", "facebook/musicgen-small")
music = synthesiser(
"lo-fi music with a soothing melody, soft keys, no vocals",
forward_params={"do_sample": True},
)
scipy.io.wavfile.write(
"musicgen_out.wav",
rate=music["sampling_rate"],
data=music["audio"],
)
MusicGen vs Stable Audio vs Suno vs Mubert
- MusicGen — open research Meta, локально/HF, NC-веса, без вокала.
- Stable Audio — другой text-to-audio стек (Stability); см. гайд.
- Suno / Udio — облако, часто вокал и песенная форма.
- Mubert / Beatoven — BGM SaaS с коммерческой лицензией на download.
Ограничения (из карточки HF)
- Нет реалистичного вокала.
- Английские описания сильнее других языков.
- Не все жанры/культуры равны по качеству.
- Иногда «обрыв» в тишину в конце фразы.
- Downstream без risk evaluation — out-of-scope по карточке.
Типичные ошибки
- Ставить large на ноутбук с 4-6 ГБ VRAM и ждать «как в демо».
- Писать промпт только по-русски и винить модель.
- Считать CC-BY-NC «можно в платную рекламу без юриста».
- Путать research-демо с готовым royalty-free кабинетом Mubert/Beatoven.
- Гонять 20 промптов вместо 3 осмысленных итераций.
FAQ: MusicGen
Что такое MusicGen простыми словами?
Открытая text-to-music модель Meta FAIR: пишете описание (лучше на английском), получаете инструментальный аудиофрагмент. Код в Audiocraft, веса на Hugging Face.
С чего начать новичку без мощной видеокарты?
Hugging Face Demo / Space или Colab из карточки модели. Локально начинайте с musicgen-small.
Можно ли коммерчески использовать трек?
Веса CC-BY-NC 4.0. Карточка предупреждает про downstream без доп. оценки. Для явной sync-лицензии под монетизацию ролика чаще берут SaaS вроде Mubert/Beatoven.
Поёт ли MusicGen?
Нет: в Limitations указано, что модель не умеет realistic vocals; вокал убирали из обучающих данных.
Чем MusicGen отличается от Suno?
MusicGen — research/open weights, локальный контроль, без песенного вокала. Suno — облачный продукт под песни с текстом.
Какая версия нужна: small, medium или large?
Small — быстрый старт. Medium/large — выше качество и требования к GPU. Melody — если нужен контроль мелодии.
Вывод
MusicGen стоит брать, когда нужен локальный/исследовательский text-to-music эскиз и вы готовы читать лицензию весов. Для фона под монетизируемый ролик «здесь и сейчас» чаще быстрее SaaS с certificate. Когда нужен разбор пайплайна под ваши задачи — смотрите форматы обучения.
Хотите нейросети под свои задачи, а не «для всех»?
Когда базовых гайдов уже мало, помогает разбор под вашу работу. Наставничество, курсы и подписка Артёма Денисова — все форматы на странице обучения. Креатив-pillar — Midjourney для начинающих.