Stable Video Diffusion — это модель искусственного интеллекта для генерации видео из изображений, которую можно запустить локально на своем компьютере без облачных сервисов. Для этого потребуются видеокарта с достаточным объемом VRAM, установленные зависимости Python и репозиторий модели от Stability AI.
Что понадобится для локального запуска
- Видеокарта NVIDIA с поддержкой CUDA (минимум 8 ГБ VRAM, рекомендуется 12+ ГБ)
- Python 3.10 или выше
- Git для клонирования репозитория
- CUDA Toolkit и cuDNN (для ускорения вычислений)
- Pip-пакеты: torch, torchvision, diffusers, transformers, pillow
- Исходное изображение в формате PNG или JPG
- Минимум 20 ГБ свободного места на диске для моделей
Пошаговая инструкция по установке и запуску
- Откройте командную строку (Windows) или терминал (Linux/macOS) от администратора.
- Проверьте версию Python командой
python --version(должна быть 3.10+). - Установите Git, если его еще нет, загрузив установщик с
git-scm.com. - Скачайте и установите CUDA Toolkit 12.1 с официального сайта NVIDIA.
- Установите cuDNN, распаковав архив в папку CUDA.
- Создайте новую папку проекта:
mkdir stable-video-diffusion. - Перейдите в папку:
cd stable-video-diffusion. - Клонируйте репозиторий Stability AI:
git clone https://github.com/Stability-AI/generative-models.git. - Перейдите в директорию:
cd generative-models. - Создайте виртуальное окружение:
python -m venv venv. - Активируйте окружение (Windows):
venv\Scripts\activateили (Linux/macOS):source venv/bin/activate. - Обновите pip:
pip install --upgrade pip. - Установите зависимости:
pip install -r requirements.txt. - Установите дополнительные пакеты:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121. - Загрузите модель Stable Video Diffusion с Hugging Face или используйте встроенный скрипт загрузки.
- Скопируйте ваше исходное изображение в папку проекта.
- Создайте Python-скрипт для генерации видео с кодом из документации репозитория.
- Запустите скрипт:
python generate_video.py --input image.png --output video.mp4. - Дождитесь завершения процесса генерации (может занять 10-30 минут в зависимости от конфигурации).
- Проверьте результат в папке проекта — видеофайл готов к использованию.
Часто задаваемые вопросы
Какой минимум VRAM нужен для работы? Для базового запуска Stable Video Diffusion требуется минимум 8 ГБ VRAM на видеокарте NVIDIA; с меньшим объемом модель будет использовать медленные вычисления на CPU.
Можно ли запустить на видеокартах AMD или Intel? Официально поддерживаются только NVIDIA с CUDA; для AMD существуют неофициальные адаптации через ROCm, но они менее стабильны и требуют дополнительной настройки.
Как улучшить качество генерируемого видео? Используйте исходные изображения высокого разрешения (2048x2048 пиксель или выше), настраивайте параметры seed для воспроизводимости результатов и экспериментируйте со значениями guidance_scale в конфиге модели.