Просьба «оживи снимок» звучит просто, а на выходе у большинства получается дёргающаяся картинка с поплывшим лицом. Причина почти всегда одна. Человек ждёт от модели фильма, а она работает отрезками в несколько секунд. И слушается не того, что изображено на снимке, а того, что вы просите на нём сделать.
Разберём по порядку: как устроено создание видео с помощью нейросети, какие модели принимают фотографию на вход, чем такое видео отличается от привычного слайд-шоу с музыкой, как построить запрос для создания видео из фото и во что обходится генерация. Характеристики моделей сверены с документацией разработчиков 26 августа 2026 года, цены — с живым прайсом сервиса на ту же дату.
Что нейросеть делает с фотографией
Модель не «дорисовывает продолжение» исходника в привычном смысле. Генерация видео устроена иначе: модель берёт изображение как первый кадр и достраивает следующие, предсказывая, как сместятся объекты, свет и точка съёмки за ближайшие несколько секунд. Поэтому исходник управляет всем визуальным рядом — композицией, цветом, стилем, — а текстовый запрос отвечает только за то, что в этом кадре произойдёт.
В справке Runway это сформулировано прямее некуда: раз изображение уже несёт информацию о персонажах, композиции, цвете и освещении, текстовый запрос должен быть почти целиком посвящён описанию желаемого движения. Правило работает и для остальных моделей.
Движение внутри кадра
Базовый сценарий, его же называют оживлением фотографии: объекты на исходном изображении начинают двигаться, а рамка стоит на месте. Волосы и одежда реагируют на ветер, вода идёт рябью, человек поворачивает голову, моргает, делает шаг. Модель сама решает, что в статичной сцене логично привести в движение, если вы не указали иное.
Чем проще заданное действие, тем выше шанс на приличный результат. Одно понятное движение на видео — рабочая норма, и она одинакова у всех моделей. Два-три действия подряд в пятисекундном отрезке модель начинает комкать: у неё физически мало кадров, чтобы отыграть их последовательно, и вместо трёх понятных движений получается одна смазанная последовательность.
Виртуальная камера
Второй слой — движение камеры. Наезд, отъезд, панорама, облёт объекта, проезд вдоль, лёгкое дрожание съёмки с рук. Модель понимает эти термины как инструкцию оператору, и именно они превращают анимированную открытку в видео, похожее на настоящую съёмку.
Часть моделей вынесла это в самостоятельный режим. У Kling он называется Motion Control и позволяет задать траекторию движения точнее, чем словами в общем запросе. Формально это тот же image-to-video: на входе изображение, на выходе видео.
Речь и звук
Дальше начинается разделение. Часть моделей для создания видео выдаёт немое изображение, звук к нему добавляют отдельно. Часть генерирует звуковую дорожку в том же проходе.
Veo 3.1 в документации Google описана как модель генерации видео с нативным звуком — аудио создаётся вместе с изображением, а не накладывается после. Kling заявил ту же способность в Kling Video 2.6: в пресс-релизе Kuaishou режим назван image-to-audio-visual, то есть из изображения сразу получается видео со звуковым рядом.
Отдельная ветка — говорящий портрет. Здесь на вход идёт не только фотография, но и звуковая дорожка, а модель подгоняет под неё артикуляцию, мимику и жесты. Так устроены OmniHuman и режимы синхронизации губ. Есть и обратная задача — собрать ролик по текстовому описанию, без исходного снимка.
Чем это отличается от слайд-шоу с музыкой
Запрос «видео из фото» долгие годы означал совсем другую задачу: собрать несколько картинок в последовательность, наложить переходы и музыку. Такие сервисы никуда не делись, и в поиске они соседствуют с нейросетевыми.
Разница принципиальная. Слайд-шоу не меняет содержимое: оно показывает готовые изображения по очереди, добавляя движение только за счёт наплывов и панорамирования. Нейросеть для создания видео работает иначе — она генерирует новые изображения, которых на исходном фото не было.
Отсюда и разные ожидания по длительности. Слайд-шоу собирается любой длины: сколько исходников, столько и минут. А видео из фото, сделанное нейросетью, живёт секунды. У Runway Gen-4 доступны отрезки 5 и 10 секунд, у остальных моделей порядок тот же. Минутное видео собирают из нескольких генераций, а не получают одной кнопкой.
То есть создать видео из фото и собрать слайд-шоу — две разные операции с разной ценой. Если задача — показать сорок фотографий с отпуска под музыку, нейросеть здесь не нужна и обойдётся дороже. Если нужно создать видео, где на неподвижном фото поехала машина или человек повернулся к вам, обычный видеоредактор этого не сделает.

Модели, которые принимают фотографию на вход
Ниже — нейросети для создания видео, доступные в chad на 26 августа 2026 года. Каталог меняется, поэтому перед работой сверяйтесь с прайсом.
Kling
Линейка Kuaishou, самая широкая по числу вариантов: в прайсе одновременно живут Kling Video 2.1, Kling Video 2.5, Kling Video 2.6 и Kling Video 3.0 в вариантах Standard, Pro и Master. Логика простая: старшие версии дают более сложное и предсказуемое движение, младшие дешевле в несколько раз. Что умеет линейка целиком — в отдельном материале.
Отдельно стоит Motion Control — режим, где траектория движения задаётся точнее, чем общим текстовым описанием. Он оправдан, когда нужно повторяющееся управляемое движение, а не произвольная интерпретация модели.
Veo
Модель Google DeepMind, актуальное поколение — 3.1. В документации Gemini API у неё есть разделы про генерацию видео из изображения, работу с референсами, задание первого и последнего кадра и продление уже готового видео. Плюс нативный звук.
Важная поправка к тому, что вы найдёте в большинстве обзоров: Veo 3 больше не существует. Google отключил её 30 июня 2026 года вместе с Veo 2 и Veo 3 Fast, объявив об этом 15 июня. Статьи, которые разбирают «тройку» как действующую модель, описывают то, чего нет — что именно поменялось между поколениями, мы разбирали отдельно.
Sora
Модель OpenAI, в прайсе представлена вариантами Sora 2 и Sora 2 Pro. Здесь нужна оговорка, которой нет ни в одном русскоязычном обзоре из выдачи.
Sora сворачивается. Веб-версия и приложения OpenAI прекращены 26 апреля 2026 года. Модель sora-2 выводится из Azure OpenAI 15 сентября 2026 года, а доступ к Sora API у самой OpenAI прекращается 24 сентября 2026 года — подробный разбор с датами и заменами у нас есть отдельно. То есть на момент публикации этого материала до отключения остаётся меньше месяца.
Практический вывод: строить на Sora регулярный рабочий процесс сейчас не стоит. Для разовой пробы она пока доступна, но выбирать её как основную нейросеть для создания видео — значит через несколько недель переучиваться заново.
Seedance
Модель ByteDance, в прайсе есть в вариантах 2.0 и 2.0 Fast. Её сильная сторона — работа с несколькими исходниками сразу: на странице модели заявлен приём до девяти изображений, видеофрагмента и аудиофайла в одном запросе.
Это тот случай, когда видео собирается не из единственного исходника, а из набора: персонаж с одной картинки, обстановка с другой, нужный ракурс с третьей. Вариант Fast быстрее и дешевле, но работает в меньшем разрешении.
Minimax Hailuo
Недорогой вход в тему из полноценных видеомоделей. В прайсе четыре позиции: Hailuo 02, 02 Fast, 2.3 и 2.3 Fast. По описанию разработчика поколение 2.3 выдаёт до десяти секунд в 768p и до шести секунд в 1080p, а версии Fast заточены под быстрые клипы из изображения.
Логика использования такая: черновики и перебор вариантов гоняются на Fast, удачную находку повторяют на старшей модели. Так вы не тратите дорогие генерации видео на поиск формулировки.
Runway
Здесь стоит держать в голове, что документация самого Runway помечает линейку Gen-4 как прошлое поколение: актуальными названы Gen-4.5 для генерации из изображения и Edit Studio Aleph 2.0 для правки готового видео. В прайсе chad на 26 августа 2026 года доступны Gen-4 Turbo, Gen-4 Aleph и Gen-3 Alpha Turbo.
При этом спецификация Gen-4 полезна как ориентир по всей нише, потому что она опубликована открыто: изображение на входе обязательно, видео 5 или 10 секунд, 24 кадра в секунду, разрешения от 1280×720 до 1584×672 в зависимости от соотношения сторон. Aleph решает другую задачу: не создать видео из фото, а переделать уже существующее.
OmniHuman и Kling Lip Sync
Две позиции для одной задачи: заставить человека на фотографии говорить. На вход подаётся портрет и звуковая дорожка, на выходе — видео с попаданием артикуляции в речь.
OmniHuman разработан ByteDance; по доступным описаниям модель ориентирована на короткие фрагменты, и лучший результат даёт чистая запись длиной порядка пятнадцати секунд, хотя заявленный предел выше. Kling Lip Sync решает ту же задачу и стоит в прайсе дешевле всех видеопозиций.
Оговорка, которую стоит держать в голове: заставлять говорить чужое лицо — это отдельная правовая история, а не просто техническая операция. У OpenAI, например, при загрузке изображений с людьми прямо требуется подтвердить согласие изображённых и права на материал.
Какая модель под какую задачу
| Задача | Что брать | Почему |
|---|---|---|
| Оживить один семейный снимок | Hailuo 2.3 Fast, Kling 2.1 Standard | дёшево, задача несложная, важнее число попыток |
| Товар для карточки или витрины | Kling 2.6 Pro, Seedance 2.0 | предсказуемое движение и аккуратная геометрия предмета |
| Говорящий аватар для соцсетей | OmniHuman, Kling Lip Sync | принимают аудио и синхронизируют артикуляцию |
| Постановочная сцена со звуком | Veo 3.1 | нативная звуковая дорожка в том же проходе |
| Сюжет из нескольких исходников | Seedance 2.0 | принимает набор референсов за один запрос |
| Управляемая траектория движения | Kling Motion Control | движение задаётся точнее, чем текстом |
| Правка уже готового ролика | Runway Aleph | это редактирование видео, а не генерация из фото |
Какой снимок подойдёт, а какой испортит результат
Требования у моделей различаются в деталях, но закономерности общие, и они объясняются тем, как устроена генерация: исходник становится первым кадром, а всё сомнительное в нём модель достраивает по своему усмотрению.
Если исходник слабый, его имеет смысл сначала привести в порядок отдельной моделью и только потом отдавать в генерацию.
Хорошо работает резкое фото, где есть один понятный главный объект, ровный свет и запас пространства вокруг. Запас важен. Модели нужно куда вести камеру, а упёршись в край, она начинает достраивать то, чего на исходном фото никогда не было. Лицо целиком, без обрезанного лба и подбородка.
Плохо работает мелкий или размытый исходник. Всё, что нельзя разглядеть, модель додумает, и чаще всего неудачно. Сложные пересечения объектов — рука перед лицом, решётка перед человеком, толпа — модель разбирает неуверенно, и границы «текут». Скриншоты с водяными знаками и подписями дают видео, где эти надписи начинают жить своей жизнью.
Отдельно про людей: лицо в анфас отрабатывается заметно стабильнее, чем в резком профиле, а групповые портреты тем труднее, чем больше на них людей. Если лиц на снимке пять, разумнее сначала обрезать до одного.
Пошаговый разбор: от снимка до готового ролика
Шаг 1. Выбрать кадр
Возьмите исходник максимального доступного качества: не пересланную в мессенджере копию, а оригинал. Проверьте, что главный объект резкий и не обрезан по краю, а вокруг него есть свободное место.
Определитесь с соотношением сторон заранее. Видео генерируется в фиксированных форматах, и если пропорции исходника не совпадают с выбранным, изображение придётся обрезать. Лучше сделать это осознанно, чем отдать на откуп автоматике.
Шаг 2. Описать одно действие
Опишите, что должно произойти, а не что изображено. «Женщина на скамейке в парке осенью» — это пересказ картинки, модель и так её видит. «Женщина медленно поворачивает голову к камере, листья за спиной шевелятся от ветра» — это инструкция.
Держитесь одного главного действия. Если хочется трёх, разбейте на три генерации видео и соедините их в монтаже: так каждый фрагмент выйдет чище, а брак не придётся переделывать целиком.
Шаг 3. Задать камеру и длительность
Добавьте, как она себя ведёт: стоит, медленно наезжает, панорамирует, облетает объект. Отсутствие указания — тоже решение, но тогда за вас выберет модель.
Длительность подбирайте под сложность. Пять секунд хватает на одно простое действие. Десять берите, когда оно разворачивается: человек встал и пошёл, машина въехала в кадр. Длинный отрезок под простое движение просто съест лишние искры, а короткий под сложное даст скомканный результат.
Шаг 4. Пересобрать неудачный дубль
Первое видео редко бывает финальным, и это нормальная часть процесса, а не признак того, что вы делаете что-то не так. Меняйте по одному параметру за попытку: сначала формулировку действия, потом работу камеры, потом длительность.
Если правите всё сразу, вы не поймёте, что именно сработало, и потеряете удачную находку. Считайте бюджет заранее: три-четыре дубля на одно готовое видео — рабочая норма, а не перерасход.

Как описать движение, чтобы модель поняла
Формула запроса
Рабочая структура собирается из четырёх частей, и порядок в ней важнее красоты формулировок:
- Кто или что двигается. Главный объект кадра, один.
- Какое действие. Одно, конкретное, в настоящем времени.
- Что делает камера. Статика, наезд, панорама, облёт.
- Темп и настроение. Медленно, плавно, резко.
Всё, что описывает фотографию, из запроса убирайте: цвет, стиль, композиция уже заданы исходником, а повторное их описание отнимает у модели внимание.
Готовые примеры под разные сюжеты
| Что на фото | Запрос |
|---|---|
| Портрет | Человек медленно поворачивает голову к камере и улыбается, камера слегка наезжает, движение плавное |
| Пейзаж | Облака медленно идут слева направо, трава колышется от ветра, панорама вправо |
| Товар | Предмет медленно поворачивается вокруг вертикальной оси, камера неподвижна, свет ровный |
| Городская улица | Прохожие идут мимо, машины проезжают на заднем плане, медленный наезд вперёд |
| Еда | Пар поднимается от блюда, медленный проход сверху к тарелке |
| Домашнее животное | Кот моргает и поворачивает голову к камере, съёмка неподвижна |
Примеры намеренно короткие. Длинный запрос не улучшает видео: модель всё равно вытянет из него одно-два главных указания, а остальное усреднит.

Сколько стоит одна генерация
В chad расход считается во внутренней валюте — искрах. Одна генерация видео тарифицируется как фиксированная сумма плюс слова запроса, ответа и контекста диалога — как именно считается расход, разбирали подробно. Актуальные цены смотрите в прайсе, на 26 августа 2026 года они такие:
| Модель | Искр за генерацию |
|---|---|
| Kling Lip Sync | от 4 000 |
| Minimax Hailuo 02 | от 14 000 |
| Kling 2.1 Standard | от 20 000 |
| OmniHuman | от 24 000 |
| Minimax Hailuo 2.3 Fast | от 25 000 |
| Runway Gen-4 Turbo | 30 000 |
| Seedance 2.0 Fast | от 32 000 |
| Kling 2.5 Turbo Pro | от 50 000 |
| Veo 3.1 | 60 000 |
| Sora 2 Pro | 140 000 |
| Kling 3.0 Pro | от 180 000 |
Пересчёт в подписку выглядит так. Тариф Опти — 590 рублей и 300 000 искр в месяц: это порядка двадцати клипов на Hailuo 02 или одно видео на Kling 3.0 Pro. Тариф Плюс — 1 690 рублей и 900 000 искр. На карточке самого дешёвого тарифа Мини строки про видео нет вовсе, хотя строки про текст и изображения там есть.
Отсюда практический вывод, который стоит сделать до покупки: пробовать создать видео из фото имеет смысл на младших моделях, а дорогие поколения включать под финальный дубль, когда формулировка уже найдена.
Ошибки, из-за которых ролик выходит неудачным
Описание картинки вместо описания движения. Частая ошибка и дорогая: модель получает пересказ того, что и так видит, и решает за вас, чему двигаться.
Несколько действий в одном коротком ролике. В пять секунд не помещается «встал, подошёл, открыл дверь». Получится смазанная последовательность вместо трёх понятных действий.
Слишком слабый или мелкий исходник. Размытый оригинал не спасает ни одна модель: то, чего в нём не видно, будет придумано.
Ожидание готового минутного видео сразу. Одна генерация укладывается в секунды. Минута собирается из фрагментов в монтаже, и планировать её надо сразу как монтаж.
Перебор вариантов на дорогой модели. Десять попыток на старшем поколении съедают месячный пакет искр за один вечер. Ищите формулировку на дешёвой модели.
Правка всех параметров за один раз. Изменив одновременно действие, камеру и длительность, вы не узнаете, что дало улучшение.
Кому принадлежит результат
Права на сгенерированный материал остаются у пользователя, использовать его можно в любых целях — это условие сервиса, а не наша интерпретация. Для бизнес-лицензий отдельно оговорено, что модели не обучаются на запросах, а данные передаются зашифрованными.
Отдельный вопрос — сама фотография. Права на неё правилами сервиса не выдаются: если там чужое лицо или чужая работа, за законность использования отвечаете вы. У части разработчиков это прописано прямо: OpenAI при загрузке изображений с людьми требует подтвердить согласие изображённых и наличие прав на материал.
Что в этой нише меняется быстрее всего
Номера версий. За последние месяцы Google отключил Veo 3, OpenAI объявил вывод Sora, Runway перевёл линейку Gen-4 в разряд прошлого поколения, а у Kling сменилось три поколения подряд. Любой список моделей с номерами версий устаревает за квартал, и этот тоже.
Что меняется медленно — принципы создания видео из фото. Изображение задаёт картинку, запрос задаёт движение, одна генерация живёт секунды, дешёвая модель нужна для поиска, дорогая для финала. Эти правила пережили уже несколько смен поколений и переживут следующую.
Практический вывод: если делаете видео с помощью нейросети регулярно, сверяйтесь с актуальным составом моделей и ценами перед работой, а не с обзором полугодовой давности — включая этот, когда он состарится.
Частые вопросы
Можно ли сделать видео из фото бесплатно
Полностью бесплатного постоянного доступа нет: генерация видео обходится дороже всех прочих операций, и лимитом её ограничивают везде. В chad бесплатен только пробный лимит на старте, дальше действуют тарифы. Этого хватает, чтобы посмотреть на качество до покупки пакета.
Нужен ли VPN
При работе через российский сервис-агрегатор — нет: доступ к моделям настроен на его стороне, оплата идёт в рублях. VPN и зарубежная карта нужны при прямой работе с сервисами разработчиков, и часть из них Россию в списке стран не поддерживает независимо от способа подключения.
Сколько длится генерация
От десятков секунд до нескольких минут. Время зависит от модели, выбранного разрешения и текущей нагрузки; варианты с пометкой Fast заметно быстрее старших версий, чем в первую очередь и оправданы на этапе перебора.
Можно ли добавить к ролику музыку
Да, но способы разные. Veo 3.1 и Kling начиная с поколения 2.6 создают звуковую дорожку сами, в том же проходе. Остальные модели отдают немой ролик — музыку к нему накладывают отдельно, в любом видеоредакторе или отдельной моделью генерации аудио.
—
Состав моделей, цены в искрах и характеристики проверены 26 августа 2026 года по документации разработчиков и живому прайсу сервиса. Ниша меняется быстро: перед работой сверяйтесь с актуальными данными.