Видео · Текст → видео · Изображение → видео

HappyHorse 1.1

Видео до 15 секунд по тексту, изображению или нескольким референсам — с устойчивыми персонажами

О модели

HappyHorse 1.1 — обновлённая видеомодель Alibaba. По сравнению с предыдущей версией она лучше понимает промпт, даёт более плавное движение и камеру и заметно надёжнее удерживает внешность персонажей и стиль сцены.

В нашем сервисе доступны все три режима:

  • Текст → видео — ролик полностью по описанию, с выбором соотношения сторон.
  • Изображение → видео — ваше изображение становится первым кадром, модель достраивает движение.
  • По референсам — до 9 изображений персонажей, предметов и окружения, которые модель собирает в одну сцену.

Длительность настраивается от 3 до 15 секунд, разрешение — 720p или 1080p.

Сильные стороны

  • Три режима — по тексту, по изображению и до 9 изображений-референсов
  • Сохраняет внешность персонажа, стиль и детали сцены от кадра к кадру
  • Естественное движение и уверенная работа камеры
  • Реалистичная фактура кожи и стабильный текст в кадре
  • Длительность от 3 до 15 секунд с шагом в секунду
  • Разрешение 720p или 1080p и девять соотношений сторон — от 21:9 до 9:21

Подходит для

  • Ролики с одним и тем же персонажем в разных сценах
  • Видео о товаре из готовых фотографий
  • Брендовые ролики с сохранением фирменного стиля
  • Короткие сюжетные видео для социальных сетей

Ограничения

  • Максимальная длительность — 15 секунд
  • Входные изображения — до 20 МБ, форматы JPEG, PNG, WEBP
  • Для референсов короткая сторона — не меньше 400 пикселей
  • Для режима «изображение → видео» — обе стороны от 300 пикселей, пропорции от 1:2,5 до 2,5:1

Советы по промптингу

  • В режиме по референсам ссылайтесь на изображения как [Image 1], [Image 2] — в порядке загрузки
  • Уточняйте, что именно взять с референса — например, «девушка в красном платье с [Image 1]»
  • Для референсов используйте чёткие изображения от 720p, без сильного сжатия
  • В режиме «изображение → видео» промпт необязателен, но описание движения и камеры даёт более точный результат