Stable Audio Open — это открытая text-to-audio модель Stability AI (карточка Hugging Face stabilityai/stable-audio-open-1.0): из текстового промпта генерируется стереозвук до ~47 секунд при 44.1 kHz. Ниже — как пользоваться Stable Audio Open локально за один вечер: веса, stable-audio-tools, лицензия community, чем Open отличается от web/API линейки Stable Audio, без выдуманных цен в рублях.
Обзор всей линейки — в гайде Stable Audio. Соседи: MusicGen, Suno, Beatoven. Видео под звук — маршрут ИИ-видео. Pillar креатива — Midjourney.
Что такое Stable Audio Open
- Open weights на Hugging Face: checkpoint + конфиг; inference через репозиторий
Stability-AI/stable-audio-tools. - Формат выхода по карточке модели: до ~47 с, stereo, 44.1 kHz (не «полный альбом» и не вокальный Suno-клон).
- Бумага: arXiv 2407.14358; лицензия community (на HF: stable-audio-community / other) — для коммерции сверяйте stability.ai/license и LICENSE модели.
- Доступ к весам: репозиторий может требовать принятие условий на HF (gated) — без аккаунта/accept файл не скачается.
Ожидание новичка: 3-5 коротких лупов/SFX под ролик или прототип саунд-дизайна. Не «песня со словами из коробки».
Open vs web/API vs MusicGen
| Слой | Длина / формат | Где | Для кого |
|---|---|---|---|
| Stable Audio Open 1.0 | до ~47 с, 44.1 kHz stereo | HF + stable-audio-tools (локально, GPU) | Офлайн-эксперименты, контроль пайплайна |
| Stable Audio web / API (2.0/3.0 линейка) | длиннее треки на витрине (до ~3-6 мин в анонсах продукта) | stableaudio.com / platform.stability.ai | Первый вечер без установки |
| MusicGen | короткие клипы, семейство Meta | HF / AudioCraft | Альтернатива open text-to-music |
| Suno / Udio | песни с вокалом | Web SaaS | Если цель — трек «как песня», не SFX |
Факты Open: huggingface.co/stabilityai/stable-audio-open-1.0 (pipeline text-to-audio; arXiv 2407.14358; ~47s @ 44.1kHz в описании карточки/линейки), github.com/Stability-AI/stable-audio-tools, анонс stability.ai/news/introducing-stable-audio-open. Цены облака Stability и железо у вас — в статье ₽/$ не фиксируем. Срез: август 2026. Полная витрина продукта — Stable Audio.
Маршрут: первый луп локально
- Железо: CUDA GPU сильно желателен. На CPU генерация будет долгой — для первого знакомства иногда проще web Stable Audio, а Open оставить на вечер с видеокартой.
- HF: аккаунт → Accept conditions на карточке
stabilityai/stable-audio-open-1.0→ токен при необходимости. - Код: поставьте зависимости
stable-audio-toolsпо README репозитория Stability-AI (версии torch/torchaudio меняются — смотрите актуальный README, не копируйте год-старые гайды вслепую). - Промпт: жанр + темп + инструменты + длина/роль («loop 8 bars», «no vocals», «soft pad for voiceover»).
- 2-3 сида одной идеи. Экспорт WAV → монтаж.
# Идея вызова (сверяйте с актуальным README stable-audio-tools):
# get_pretrained_model("stabilityai/stable-audio-open-1.0")
# generate_diffusion_cond(...) → torchaudio.save("loop.wav", ...)
Промпт (пример):
lo-fi hip-hop drum loop, 85 BPM, dusty snare, soft kick, no melody, seamless loop, no vocals
Лицензия и коммерция
- Веса Open идут с community-лицензией Stability — читайте LICENSE.md на HF и stability.ai/license до коммерческого релиза.
- Обучающие данные заявлены как лицензированные/атрибуцированные наборы (в карточке есть attribution CSV) — это не «скачал и забыл про права».
- Для клиента «под ключ» чаще проще web/API с понятным ToS кабинета, чем спор с юристом по open-весам.
Типичные ошибки
- Ждать вокал и куплеты как у Suno — Open про инструментал/SFX/короткий клип.
- Путать Open 1.0 (~47 с) с анонсами Stable Audio 2.0/3.0 на минуты.
- Ставить пайплайн без Accept на HF и удивляться 401.
- Копировать коммерческий трек клиента «как референс» в нарушение ToS/права.
FAQ: Stable Audio Open
Что такое Stable Audio Open простыми словами?
Открытые веса Stability AI для генерации короткого стереозвука из текста (до ~47 с @ 44.1 kHz) через stable-audio-tools.
Чем Open отличается от обычного Stable Audio?
Open — локальные веса и свой пайплайн. Web/API линейки 2.0/3.0 — облако и более длинные треки на витрине продукта. Обзор: Stable Audio.
Нужна ли видеокарта?
Практически да для комфортной скорости. Без GPU разумнее начать с web-слоя продукта, а Open отложить.
Можно ли использовать в коммерции?
Смотрите LICENSE модели и stability.ai/license. Community-лицензия ≠ «делай что хочешь». При сомнении — юр.сверка или облачный план с явным ToS.
Как скачать модель?
Hugging Face карточка stabilityai/stable-audio-open-1.0: Accept → download через huggingface_hub / git lfs по инструкции HF. Репозиторий gated.
Stable Audio Open vs MusicGen?
Оба open/локальные маршруты text-to-audio. Разная архитектура и длина/стиль. Сравнивайте на одном промпте под ваш SFX.
Вывод
Stable Audio Open — выбор, когда нужен офлайн-контроль коротких лупов и SFX. Для «песни со словами» берите другой класс инструментов. Когда нужна система обучения креативу, а не ещё один checkpoint — смотрите форматы на странице обучения.
Хотите нейросети под свои задачи, а не «для всех»?
Когда базовых гайдов уже мало, помогает разбор под вашу работу. Наставничество, курсы и подписка Артёма Денисова — все форматы на странице обучения. Креатив-направление — «ИИ-креатив» и pillar Midjourney.