MusicGen — это text-to-music модель Meta FAIR (Audiocraft): описание на английском или audio/melody prompt на входе, инструментальный WAV на выходе. Ниже — как пользоваться MusicGen новичку за один вечер через Hugging Face Demo / Transformers / локальный Audiocraft, без выдуманных подписок в рублях.

Соседи: Stable Audio, Mubert, Beatoven, Suno, Udio. Локальный стек рядом с Ollama / LM Studio. Карта новичка — нейросети для начинающих.

Что умеет MusicGen

  1. Text-to-music — генерация по текстовому описанию (основной сценарий README/HF).
  2. Melody-guided — вариант musicgen-melody: опора на мелодию/аудио-условие (см. карточку модели).
  3. Один проход по codebooks — EnCodec 32 kHz, 4 codebooks @ 50 Hz; без отдельного semantic LM как у MusicLM (описание статьи/карточки).
  4. Размеры чекпоинтов: small ~300M, medium ~1.5B, large ~3.3B параметров (+ melody).
  5. Лицензия весов: CC-BY-NC 4.0; код Audiocraft — MIT (карточка HF / репозиторий).

Ожидание новичка: 8-30 секунд инструментального эскиза под mood, а не готовый коммерческий хит с вокалом. В Limitations HF прямо: realistic vocals модель не генерирует; английские описания работают лучше.

Чекпоинты и точки входа

Чекпоинт / вход Ориентир Для кого На что смотреть
facebook/musicgen-small ~300M Быстрый тест, слабее GPU Качество ниже large
facebook/musicgen-medium ~1.5B Баланс качества/VRAM Нужна заметная видеопамять
facebook/musicgen-large ~3.3B Лучшее качество из релиза Тяжелее железо
facebook/musicgen-melody melody-guided Контроль мелодии Нужен audio/melody input
HF Demo / Spaces / Colab Без локальной установки Новичок Очередь и лимиты демо
Audiocraft (GitHub) pip + ffmpeg Локальный пайплайн GPU/RAM, MIT код

Источники: huggingface.co/facebook/musicgen-small (и sibling-карточки); статья arXiv:2306.05284 «Simple and Controllable Music Generation»; github.com/facebookresearch/audiocraft. Веса CC-BY-NC 4.0 — коммерческий downstream без доп. оценки рисков в карточке помечен out-of-scope. Срез: август 2026. Цен в ₽ у open-weights нет.

Маршрут: первый трек за вечер

  1. Без железа: откройте Hugging Face Demo / Space для MusicGen, один английский промпт, 1-2 дубля.
  2. С кодом: pip install transformers scipy → pipeline text-to-audio с facebook/musicgen-small (пример в карточке HF).
  3. Локально «по-взрослому»: Audiocraft + ffmpeg, MusicGen.get_pretrained("small"), set_generation_params(duration=8).
  4. Промпт: genre + instruments + mood + tempo; без запроса «спеть куплет» — вокала не будет.
  5. Права: CC-BY-NC на веса ≠ «можно в рекламу клиента». Для коммерческого BGM чаще смотрят SaaS с явной sync-лицензией (Mubert, Beatoven).
from transformers import pipeline
import scipy

synthesiser = pipeline("text-to-audio", "facebook/musicgen-small")
music = synthesiser(
    "lo-fi music with a soothing melody, soft keys, no vocals",
    forward_params={"do_sample": True},
)
scipy.io.wavfile.write(
    "musicgen_out.wav",
    rate=music["sampling_rate"],
    data=music["audio"],
)

MusicGen vs Stable Audio vs Suno vs Mubert

  • MusicGen — open research Meta, локально/HF, NC-веса, без вокала.
  • Stable Audio — другой text-to-audio стек (Stability); см. гайд.
  • Suno / Udio — облако, часто вокал и песенная форма.
  • Mubert / Beatoven — BGM SaaS с коммерческой лицензией на download.

Ограничения (из карточки HF)

  • Нет реалистичного вокала.
  • Английские описания сильнее других языков.
  • Не все жанры/культуры равны по качеству.
  • Иногда «обрыв» в тишину в конце фразы.
  • Downstream без risk evaluation — out-of-scope по карточке.

Типичные ошибки

  • Ставить large на ноутбук с 4-6 ГБ VRAM и ждать «как в демо».
  • Писать промпт только по-русски и винить модель.
  • Считать CC-BY-NC «можно в платную рекламу без юриста».
  • Путать research-демо с готовым royalty-free кабинетом Mubert/Beatoven.
  • Гонять 20 промптов вместо 3 осмысленных итераций.

FAQ: MusicGen

Что такое MusicGen простыми словами?

Открытая text-to-music модель Meta FAIR: пишете описание (лучше на английском), получаете инструментальный аудиофрагмент. Код в Audiocraft, веса на Hugging Face.

С чего начать новичку без мощной видеокарты?

Hugging Face Demo / Space или Colab из карточки модели. Локально начинайте с musicgen-small.

Можно ли коммерчески использовать трек?

Веса CC-BY-NC 4.0. Карточка предупреждает про downstream без доп. оценки. Для явной sync-лицензии под монетизацию ролика чаще берут SaaS вроде Mubert/Beatoven.

Поёт ли MusicGen?

Нет: в Limitations указано, что модель не умеет realistic vocals; вокал убирали из обучающих данных.

Чем MusicGen отличается от Suno?

MusicGen — research/open weights, локальный контроль, без песенного вокала. Suno — облачный продукт под песни с текстом.

Какая версия нужна: small, medium или large?

Small — быстрый старт. Medium/large — выше качество и требования к GPU. Melody — если нужен контроль мелодии.

Вывод

MusicGen стоит брать, когда нужен локальный/исследовательский text-to-music эскиз и вы готовы читать лицензию весов. Для фона под монетизируемый ролик «здесь и сейчас» чаще быстрее SaaS с certificate. Когда нужен разбор пайплайна под ваши задачи — смотрите форматы обучения.

Артём Денисов эксперт Нетологии и автор курса Яндекс Практикума по промпт-инжинирингу. Помогает выбрать: open-weights эксперимент или лицензированный BGM под контент.

Хотите нейросети под свои задачи, а не «для всех»?

Когда базовых гайдов уже мало, помогает разбор под вашу работу. Наставничество, курсы и подписка Артёма Денисова — все форматы на странице обучения. Креатив-pillar — Midjourney для начинающих.