Коротко
- Gemini Omni и Veo могут использовать изображение как начальный кадр видео.
- В документации для Gemini Omni 1.1 Flash Preview указана длительность от 3 до 10 секунд.
- Промпт можно составить более управляемо, разделив описание на объект, движение, место действия и камеру.
- Для работы с REST API нужны проект Google Cloud, Agent Platform API и аутентификация.
Чему вы научитесь в этом руководстве?
При превращении архитектурного изображения в короткое видео важно не просто добавить движение, но и сохранить читаемость проекта. В этом руководстве мы разберём, как использовать готовое изображение в качестве начального кадра, задавать движение короткими и понятными формулировками, выбирать работу камеры и понимать основные настройки в примере API. Примеры подготовлены для визуализаций жилых интерьеров, фасадов и ландшафтов.
Согласно документации Google, Gemini Omni и Veo могут создавать видео на основе готового изображения. Эта возможность доступна через Gemini Enterprise Agent Platform Media Studio или API генерации видео. Результаты могут различаться от одного промпта к другому, поэтому первые попытки лучше делать короткими и сосредоточенными на одной идее движения.
Требования: учётная запись, модель и изображение
Для работы через Media Studio или API нужна учётная запись Google Cloud и выбранный либо созданный проект Google Cloud. При использовании API необходимо активировать Agent Platform API и отправлять запросы с аутентификацией. В документации также указано, что для запуска примера REST в локальной среде разработки нужно установить Google Cloud CLI и пройти аутентификацию через CLI. При доступе через консоль отдельная настройка аутентификации, согласно документации, не требуется.
Среди моделей, для которых задокументирована генерация видео из изображения, — gemini-omni-1.1-flash-preview, а также несколько моделей Veo 3.0 и Veo 3.1. В шагах ниже используется пример API Gemini Omni, где подробно описаны входное изображение и настройки. В запросе API изображение передаётся по URI Cloud Storage; в примере указан MIME-тип image/png. Поэтому перед началом убедитесь, что изображение доступно в проекте и в запросе указан верный путь.
В примере API для длительности указаны целые значения от 3 до 10 секунд, а для соотношения сторон — варианты 16:9 или 9:16. Если разрешение не задано, по умолчанию создаётся видео в 720p; для gemini-omni-1.1-flash-preview в документации перечислены варианты 360p, 720p, 1080p и 4K. Если вы используете другую модель, отдельно проверьте поддерживаемые настройки. В источниках нет информации о ценах.
Пошагово: готовим промпт для архитектурного изображения
Определите одну цель. Выберите, какой элемент изображения должен ожить: например, меняющийся дневной свет в интерьере, медленное движение камеры вдоль фасада или лёгкое колыхание листьев во дворе. Вместо нескольких крупных событий в одном промпте задайте одно основное действие.
Укажите объект и контекст. В руководстве по промптам объект, действие и контекст сцены рассматриваются как отдельные компоненты. В архитектурной визуализации объектом могут быть комната, фасад, лестница или двор. Для описания контекста кратко укажите материалы, время суток и характер освещения. Просьба добавить новые архитектурные элементы, которых нет на изображении, может противоречить цели сохранить проект.
Задайте движение сдержанно. В первой попытке попросите о небольшом движении: например, чтобы свет медленно скользил по стене или слегка колыхались шторы и растения. В руководстве подчёркивается, что действие описывает происходящее в видео. Поэтому вместо общих фраз вроде «сделай кинематографично» уточните, что именно и как должно двигаться.
Выберите поведение камеры. Можно указать статичный кадр, медленную панораму или движение dolly. Движение камеры влияет на восприятие пространства, поэтому не стоит объединять в одном промпте сразу несколько типов движения. Google отмечает, что поддержка некоторых продвинутых ракурсов официально не гарантируется, а надёжность результатов может различаться.
Примеры ниже подготовлены для архитектурных задач в рамках этого руководства; это не промпты, дословно взятые из источника.
A calm architectural interior visualization of a contemporary living room, soft morning daylight slowly moving across the pale stone floor, sheer curtains gently shifting in a light breeze, preserve the room layout and materials, static wide shot, subtle natural motionВ этом промпте основное изменение — солнечный свет, медленно перемещающийся по полу; движение штор задано как второстепенное и лёгкое. Статичный общий план сосредоточен на том, чтобы показать планировку интерьера.
A contemporary timber house seen from the garden, leaves on nearby trees moving gently in the breeze, soft overcast daylight, preserve the façade design and proportions, slow truck right along the garden edge, restrained architectural visualizationВ этом примере с фасадом камера медленно движется вправо, а листья на деревьях слегка колышутся. Просьба сохранить пропорции фасада подчёркивает роль изображения в презентации проекта, однако результат всё равно нужно проверить.
A quiet courtyard in a contemporary residential project at golden hour, subtle movement in ornamental grasses, warm light changing gently on the paving, preserve the original landscape composition, static wide shot, realistic restrained motionПромпт для двора описывает ограниченное движение растений и изменение света. Статичную камеру можно попробовать для презентаций, где композиция важнее движения.
Передайте изображение вместе с настройками. В примере API запрос включает не только текстовый промпт, но и входное изображение, а задача обозначена как
image_to_video. В запрос также можно добавить соотношение сторон, разрешение и длительность. Для быстрого теста можно выбрать 16:9 и небольшую длительность; это лишь пример настроек, а не универсальный вариант для любой задачи.Дождитесь завершения обработки и проверьте результат. В документации указано, что генерация видео может занимать больше минуты. После завершения синхронного запроса результат возвращается в ответе; для асинхронных запросов, работающих в фоновом режиме, результат позднее запрашивается по идентификатору взаимодействия. Указано, что асинхронные запросы хранятся не более 14 дней.
Распространённые ошибки
Слишком много движения: Если одновременно задать изменение света, движение камеры, людей и погодные эффекты, оценить результат будет сложнее. Сначала создайте версию с одним движением, а если она вас устраивает, добавьте ещё один элемент в следующей попытке.
Неопределённое описание камеры: Вместо фразы «двигай камеру» выберите конкретный тип движения — статичный кадр, pan или dolly. Продвинутые ракурсы могут работать не одинаково надёжно в каждом случае.
Не проверять длительность и разрешение: В примере API длительность составляет от 3 до 10 секунд. Перед отправкой запроса проверьте разрешения и соотношения сторон, поддерживаемые моделью; в документации говорится, что разрешение по умолчанию — 720p, если оно не задано.
Считать результат точной документацией проекта: Генерация видео добавляет изображению движение, однако источники не гарантируют архитектурную точность или неизменность элементов проекта в каждом кадре. Рассматривайте созданный ролик как черновик визуального повествования, а не как технический чертёж или точную запись проекта.
Применение в архитектурном и визуализационном процессе
Этот метод можно попробовать архитектурным бюро, дизайнерам интерьеров и художникам по визуализации, которым нужно подготовить короткий презентационный ролик на основе статичного изображения интерьера или фасада. На обсуждениях проекта может пригодиться анимированный эскиз, передающий свет, атмосферу или ощущение пространства. Однако доступные источники не гарантируют, насколько точным будет результат для профессиональной презентации и сохранятся ли архитектурные детали в каждой сцене. Поэтому результат нужно сравнить с изображениями проекта и при необходимости сгенерировать заново.
В рабочем процессе важны два практических аспекта: требования к настройке, например облачный проект и доступ к API, а также поддерживаемые моделью параметры длительности, разрешения и соотношения сторон. В источниках не раскрываются цены и требования к локальному оборудованию; вместо предположений на эти темы перед генерацией следует проверить актуальные условия сервиса и настройки проекта. Пример API, в котором изображение передаётся через Cloud Storage, также показывает, что расположение файла — часть процесса.
Что делать дальше
В первой попытке используйте одно и то же изображение и одинаковые настройки, меняя только описание движения в промпте. Так вы сможете сравнить, что сильнее влияет на результат: движение камеры или описание освещения. Затем протестируйте подходящую версию с другими настройками длительности или соотношения сторон. Если вы работаете через REST, учитывайте разницу: синхронный запрос сразу возвращает результат, а при асинхронном способе результат позднее запрашивается по идентификатору взаимодействия.
Источник и лицензия
Это руководство адаптировано на русский язык на основе официальных руководств Google Cloud «Video generation prompt guide» и «Generate videos from an image». Оба источника распространяются по лицензии CC BY 4.0. Архитектурные примеры промптов подготовлены специально для этой статьи.
Источники
Источников: 2Тексты источников не перепечатываются; короткие цитаты отмечены, остальное — наш пересказ и комментарий.
Превращение архитектурного изображения в короткий ролик — практичный способ передать атмосферу, особенно в презентациях концепций. Однако источники не гарантируют, что проектные решения будут в точности сохранены в каждом кадре. Поэтому результат правильнее рассматривать не как подтверждение проекта, а как контролируемый черновик визуального повествования.
Бюро и студентам в Турции перед началом работы стоит учесть такие требования, как проект Google Cloud, доступ к API и хранение изображения в облаке. Поскольку источники не раскрывают цены и требования к локальному оборудованию, не следует делать предположения о стоимости; перед генерацией нужно проверить условия сервиса.
Частые вопросы
Можно ли создавать видео из архитектурного изображения с помощью Gemini Omni?
Да. Согласно документации Google Cloud, Gemini Omni и Veo могут использовать готовое изображение в качестве первого кадра видео.
Какую длительность поддерживает Gemini Omni при создании видео из изображения?
В примере API указана длительность от 3 до 10 секунд в виде целого значения.
Что нужно для создания видео через Gemini Omni API?
Нужны учётная запись и проект Google Cloud, активированный Agent Platform API и аутентификация. В примере запроса изображение передаётся по URI Cloud Storage.



