Stable Video Diffusion локально на своем компьютере

Как использовать Stable Video Diffusion локально на своем компьютере

Stable Video Diffusion — это модель искусственного интеллекта для генерации видео из изображений, которую можно запустить локально на своем компьютере без облачных сервисов. Для этого потребуются видеокарта с достаточным объемом VRAM, установленные зависимости Python и репозиторий модели от Stability AI.

Что понадобится для локального запуска

  • Видеокарта NVIDIA с поддержкой CUDA (минимум 8 ГБ VRAM, рекомендуется 12+ ГБ)
  • Python 3.10 или выше
  • Git для клонирования репозитория
  • CUDA Toolkit и cuDNN (для ускорения вычислений)
  • Pip-пакеты: torch, torchvision, diffusers, transformers, pillow
  • Исходное изображение в формате PNG или JPG
  • Минимум 20 ГБ свободного места на диске для моделей

Пошаговая инструкция по установке и запуску

  1. Откройте командную строку (Windows) или терминал (Linux/macOS) от администратора.
  2. Проверьте версию Python командой python --version (должна быть 3.10+).
  3. Установите Git, если его еще нет, загрузив установщик с git-scm.com.
  4. Скачайте и установите CUDA Toolkit 12.1 с официального сайта NVIDIA.
  5. Установите cuDNN, распаковав архив в папку CUDA.
  6. Создайте новую папку проекта: mkdir stable-video-diffusion.
  7. Перейдите в папку: cd stable-video-diffusion.
  8. Клонируйте репозиторий Stability AI: git clone https://github.com/Stability-AI/generative-models.git.
  9. Перейдите в директорию: cd generative-models.
  10. Создайте виртуальное окружение: python -m venv venv.
  11. Активируйте окружение (Windows): venv\Scripts\activate или (Linux/macOS): source venv/bin/activate.
  12. Обновите pip: pip install --upgrade pip.
  13. Установите зависимости: pip install -r requirements.txt.
  14. Установите дополнительные пакеты: pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121.
  15. Загрузите модель Stable Video Diffusion с Hugging Face или используйте встроенный скрипт загрузки.
  16. Скопируйте ваше исходное изображение в папку проекта.
  17. Создайте Python-скрипт для генерации видео с кодом из документации репозитория.
  18. Запустите скрипт: python generate_video.py --input image.png --output video.mp4.
  19. Дождитесь завершения процесса генерации (может занять 10-30 минут в зависимости от конфигурации).
  20. Проверьте результат в папке проекта — видеофайл готов к использованию.

Часто задаваемые вопросы

Какой минимум VRAM нужен для работы? Для базового запуска Stable Video Diffusion требуется минимум 8 ГБ VRAM на видеокарте NVIDIA; с меньшим объемом модель будет использовать медленные вычисления на CPU.

Можно ли запустить на видеокартах AMD или Intel? Официально поддерживаются только NVIDIA с CUDA; для AMD существуют неофициальные адаптации через ROCm, но они менее стабильны и требуют дополнительной настройки.

Как улучшить качество генерируемого видео? Используйте исходные изображения высокого разрешения (2048x2048 пиксель или выше), настраивайте параметры seed для воспроизводимости результатов и экспериментируйте со значениями guidance_scale в конфиге модели.

Похожие материалы

Промо-ролик для мобильного приложения полностью в нейросетях
Параметры детализации и резкости при генерации ИИ-видео
Оживление статичной картинки с помощью ИИ-инструментов Sora от OpenAI