Stable Audio Open — это открытая text-to-audio модель Stability AI (карточка Hugging Face stabilityai/stable-audio-open-1.0): из текстового промпта генерируется стереозвук до ~47 секунд при 44.1 kHz. Ниже — как пользоваться Stable Audio Open локально за один вечер: веса, stable-audio-tools, лицензия community, чем Open отличается от web/API линейки Stable Audio, без выдуманных цен в рублях.

Обзор всей линейки — в гайде Stable Audio. Соседи: MusicGen, Suno, Beatoven. Видео под звук — маршрут ИИ-видео. Pillar креатива — Midjourney.

Что такое Stable Audio Open

  1. Open weights на Hugging Face: checkpoint + конфиг; inference через репозиторий Stability-AI/stable-audio-tools.
  2. Формат выхода по карточке модели: до ~47 с, stereo, 44.1 kHz (не «полный альбом» и не вокальный Suno-клон).
  3. Бумага: arXiv 2407.14358; лицензия community (на HF: stable-audio-community / other) — для коммерции сверяйте stability.ai/license и LICENSE модели.
  4. Доступ к весам: репозиторий может требовать принятие условий на HF (gated) — без аккаунта/accept файл не скачается.

Ожидание новичка: 3-5 коротких лупов/SFX под ролик или прототип саунд-дизайна. Не «песня со словами из коробки».

Open vs web/API vs MusicGen

Слой Длина / формат Где Для кого
Stable Audio Open 1.0 до ~47 с, 44.1 kHz stereo HF + stable-audio-tools (локально, GPU) Офлайн-эксперименты, контроль пайплайна
Stable Audio web / API (2.0/3.0 линейка) длиннее треки на витрине (до ~3-6 мин в анонсах продукта) stableaudio.com / platform.stability.ai Первый вечер без установки
MusicGen короткие клипы, семейство Meta HF / AudioCraft Альтернатива open text-to-music
Suno / Udio песни с вокалом Web SaaS Если цель — трек «как песня», не SFX

Факты Open: huggingface.co/stabilityai/stable-audio-open-1.0 (pipeline text-to-audio; arXiv 2407.14358; ~47s @ 44.1kHz в описании карточки/линейки), github.com/Stability-AI/stable-audio-tools, анонс stability.ai/news/introducing-stable-audio-open. Цены облака Stability и железо у вас — в статье ₽/$ не фиксируем. Срез: август 2026. Полная витрина продукта — Stable Audio.

Маршрут: первый луп локально

  1. Железо: CUDA GPU сильно желателен. На CPU генерация будет долгой — для первого знакомства иногда проще web Stable Audio, а Open оставить на вечер с видеокартой.
  2. HF: аккаунт → Accept conditions на карточке stabilityai/stable-audio-open-1.0 → токен при необходимости.
  3. Код: поставьте зависимости stable-audio-tools по README репозитория Stability-AI (версии torch/torchaudio меняются — смотрите актуальный README, не копируйте год-старые гайды вслепую).
  4. Промпт: жанр + темп + инструменты + длина/роль («loop 8 bars», «no vocals», «soft pad for voiceover»).
  5. 2-3 сида одной идеи. Экспорт WAV → монтаж.
# Идея вызова (сверяйте с актуальным README stable-audio-tools):
# get_pretrained_model("stabilityai/stable-audio-open-1.0")
# generate_diffusion_cond(...) → torchaudio.save("loop.wav", ...)

Промпт (пример):
lo-fi hip-hop drum loop, 85 BPM, dusty snare, soft kick, no melody, seamless loop, no vocals

Лицензия и коммерция

  • Веса Open идут с community-лицензией Stability — читайте LICENSE.md на HF и stability.ai/license до коммерческого релиза.
  • Обучающие данные заявлены как лицензированные/атрибуцированные наборы (в карточке есть attribution CSV) — это не «скачал и забыл про права».
  • Для клиента «под ключ» чаще проще web/API с понятным ToS кабинета, чем спор с юристом по open-весам.

Типичные ошибки

  • Ждать вокал и куплеты как у Suno — Open про инструментал/SFX/короткий клип.
  • Путать Open 1.0 (~47 с) с анонсами Stable Audio 2.0/3.0 на минуты.
  • Ставить пайплайн без Accept на HF и удивляться 401.
  • Копировать коммерческий трек клиента «как референс» в нарушение ToS/права.

FAQ: Stable Audio Open

Что такое Stable Audio Open простыми словами?

Открытые веса Stability AI для генерации короткого стереозвука из текста (до ~47 с @ 44.1 kHz) через stable-audio-tools.

Чем Open отличается от обычного Stable Audio?

Open — локальные веса и свой пайплайн. Web/API линейки 2.0/3.0 — облако и более длинные треки на витрине продукта. Обзор: Stable Audio.

Нужна ли видеокарта?

Практически да для комфортной скорости. Без GPU разумнее начать с web-слоя продукта, а Open отложить.

Можно ли использовать в коммерции?

Смотрите LICENSE модели и stability.ai/license. Community-лицензия ≠ «делай что хочешь». При сомнении — юр.сверка или облачный план с явным ToS.

Как скачать модель?

Hugging Face карточка stabilityai/stable-audio-open-1.0: Accept → download через huggingface_hub / git lfs по инструкции HF. Репозиторий gated.

Stable Audio Open vs MusicGen?

Оба open/локальные маршруты text-to-audio. Разная архитектура и длина/стиль. Сравнивайте на одном промпте под ваш SFX.

Вывод

Stable Audio Open — выбор, когда нужен офлайн-контроль коротких лупов и SFX. Для «песни со словами» берите другой класс инструментов. Когда нужна система обучения креативу, а не ещё один checkpoint — смотрите форматы на странице обучения.

Артём Денисов эксперт Нетологии и автор курса Яндекс Практикума по промпт-инжинирингу. Помогает выбрать локальный аудио-стек под задачу, а не скачивать веса «потому что open».

Хотите нейросети под свои задачи, а не «для всех»?

Когда базовых гайдов уже мало, помогает разбор под вашу работу. Наставничество, курсы и подписка Артёма Денисова — все форматы на странице обучения. Креатив-направление — «ИИ-креатив» и pillar Midjourney.