Коротко
- Gemini Omni и некоторые модели Veo позволяют использовать существующее изображение в качестве первого кадра видео.
- Для Gemini Omni 1.1 Flash Preview можно выбрать длительность видео от 3 до 10 секунд.
- В API-запросе можно указать соотношение сторон 16:9 или 9:16; если разрешение не задано, используется значение по умолчанию — 720p.
- Промпт можно структурировать с помощью описаний объекта, движения, сцены и камеры.
Что вы узнаете из этого руководства?
Вы узнаете, как использовать рендер интерьера или архитектурное изображение в качестве начального кадра короткого видео, а затем текстом описать, что должно в нём измениться. Согласно документации Google, Gemini Omni и Veo поддерживают создание видео на основе существующего изображения. Описанный здесь рабочий процесс предназначен для архитекторов, дизайнеров интерьеров и специалистов по визуализации, которые хотят напрямую оживить изображение.
Важно понимать ключевое отличие: вместо того чтобы просто написать промпт для видео, вы задаёте существующее изображение в качестве начального кадра и отдельно описываете движение. В промпте можно указать, что изображено, что происходит, где и когда разворачивается сцена и как ведёт себя камера. Необязательно использовать все эти категории в каждом промпте, но раздельное рассмотрение компонентов помогает яснее описать желаемые изменения.
Требования и выбор модели
Необходимо войти в аккаунт Google Cloud и выбрать или создать проект Google Cloud. Если вы работаете через API, также нужно включить Agent Platform API и настроить аутентификацию для своей среды. В документации указано, что при работе через консоль отдельная настройка аутентификации не требуется, а для примеров REST можно использовать учётные данные Google Cloud CLI.
Создавать видео из изображения можно через Gemini Enterprise Agent Platform Media Studio или API для генерации видео. В этом руководстве мы используем модель gemini-omni-1.1-flash-preview, название которой прямо указано в документации. Среди других моделей, поддерживающих эту функцию, перечислены Veo 3.1 Lite, Veo 3.1, Veo 3.1 Fast, Veo 3.0 и Veo 3.0 Fast. Подробности о доступе к моделям, условиях для аккаунта и стоимости использования, не приведённые здесь, следует проверить в актуальной информации о продуктах Google Cloud.
В примере API входное изображение передаётся по адресу Cloud Storage, а тип MIME указан как image/png. Для Gemini Omni 1.1 Flash Preview доступны разрешения 360p, 720p, 1080p и 4K, а также соотношения сторон 16:9 и 9:16. Если разрешение не указано, по умолчанию используется 720p. Длительность видео можно задавать целым числом секунд от 3 до 10. Это параметры API из документации; не следует считать, что те же настройки доступны в других моделях или интерфейсах.
Пошаговое создание видео из архитектурного изображения
Выберите исходное изображение. Определите, какое архитектурное изображение хотите использовать. Это может быть, например, перспектива интерьера или визуализация фасада здания. Изображение станет первым кадром создаваемого видео. Заранее отметьте, какие элементы должны двигаться: деревья, занавески, поверхность воды или сама камера.
Выберите способ генерации. Если вы работаете через интерфейс, используйте Media Studio; если настраиваете программный рабочий процесс — API. Для работы через API нужно выбрать проект и включить Agent Platform API. При использовании REST также необходимо настроить аутентификацию. В примере API для создания видео из изображения запрос отправляется с задачей
image_to_video.Разбейте промпт на составляющие. В руководстве Google по промптам рассматриваются такие элементы, как объект, действие, сцена или контекст, ракурс камеры и её движение. В архитектурной сцене объектом может быть само пространство или здание, а действие описывает ожидаемое движение в кадре. Затем добавьте детали сцены — например, дневной свет, погоду и окружение — и описание камеры: статичный кадр или медленное движение.
Используйте пример ниже как отправную точку. Проверяйте варианты промпта по отдельности, чтобы понять, какое описание лучше сочетается с изображением.
A calm architectural interior, sheer curtains moving gently in a light breeze, soft morning daylight shifting across the timber floor, wide shot, static camera, preserve the original room layout and material paletteВ этом примере помещение — объект, движение занавесок — действие, утренний свет — описание сцены, а широкий план и статичная камера — параметры съёмки. Промпт рассчитан на небольшое контролируемое движение в статичной архитектурной визуализации.
Для экстерьера ограничьте движение. Если описать движение окружающих элементов, а не самого здания, станет яснее, какая часть сцены должна ожить.
A contemporary house in a landscaped garden, leaves and tall grasses moving gently in the wind, late afternoon light, a slow dolly in toward the entrance, wide establishing shotЗдесь отдельно описаны движение растений, освещение и приближение камеры к зданию. «Dolly in» означает физическое приближение камеры к объекту; не путайте этот приём с zoom — увеличением масштаба изображения.
Настройте параметры API под целевой результат. В запросе указываются модель, текстовый промпт и входное изображение; тип результата задаётся как видео, а в качестве задачи выбирается
image_to_video. Для горизонтальной презентации можно выбрать соотношение сторон 16:9, а для вертикальной публикации — 9:16. Укажите длительность от 3 до 10 секунд. Если не задать разрешение, в примере API используется значение по умолчанию — 720p.Дождитесь генерации и проверьте результат. Google отмечает, что создание видео может занимать более минуты. При синхронном запросе готовое видео можно скачать; для асинхронного используется параметр фонового выполнения, а результат можно позднее запросить по идентификатору взаимодействия. Указано, что асинхронные запросы хранятся до 14 дней. Перед использованием в презентации проверьте, соответствуют ли архитектурные формы, материалы и движение исходному изображению.
Частые ошибки
Сводить промпт к одной расплывчатой фразе: общее описание вроде «создай красивое архитектурное видео» не разделяет объект, движение, окружение и настройки камеры. Чётко укажите, какой элемент должен двигаться и должна ли камера оставаться неподвижной или двигаться.
Использовать несовместимые указания для камеры: просьба одновременно оставить камеру неподвижной и приблизить её к зданию может привести к противоречию. Сначала выберите один тип поведения камеры, а затем попробуйте другой вариант в отдельной генерации.
Забывать о длительности и соотношении сторон: длительность видео в API выбирается в диапазоне от 3 до 10 секунд; в документации сказано, что соотношение сторон можно определить по промпту, если оно не задано. Тем не менее, если вам нужен горизонтальный или вертикальный результат, явное указание формата поможет провести более контролируемый эксперимент.
Считать результат точной копией исходного изображения: документация описывает использование изображения в качестве первого кадра и управление генерацией с помощью промпта, но не гарантирует, что геометрия здания или материалы всегда будут сохранены без изменений. Поэтому внимательно проверяйте видео перед важной презентацией или передачей заказчику.
Следующие шаги: как использовать это в архитектурном рабочем процессе?
Этот метод можно попробовать командам архитекторов и дизайнеров интерьеров, которым нужны альтернативные варианты презентации с коротким движением в статичном изображении. Он позволяет экспериментировать с движением камеры, изменением освещения или движением элементов сцены — растений, занавесок и других объектов. Однако геометрию проекта в исходном изображении и готовом видео необходимо проверять; не рассматривайте результат как технический чертёж, размерный план или окончательный проектный документ.
Студенты и специалисты по визуализации могут испытывать разные варианты движения и описания камеры на основе одного и того же начального кадра. Офисам следует заранее оценить, через какой аккаунт и сервис будут обрабатываться изображения проекта, а также условия доступа и возможные расходы. Поскольку в источниках не указана стоимость, актуальные условия продукта нужно проверить отдельно для расчёта бюджета. При использовании API в рабочий процесс также добавляются выбор проекта, включение API и настройка аутентификации.
Источники и лицензия
Это руководство адаптировано на турецкий язык на основе страниц Google Cloud «Video generation prompt guide» и «Generate videos from an image». Оба источника опубликованы по лицензии CC BY 4.0.
Источники
Источников: 2Тексты источников не перепечатываются; короткие цитаты отмечены, остальное — наш пересказ и комментарий.
Для архитектурных бюро и студий дизайна интерьеров практическая ценность этого подхода заключается в том, что из существующего рендера можно подготовить короткие варианты презентации. Описание движения камеры и окружающих элементов в промпте может быть полезно командам, которые хотят попробовать представить статичное изображение в другом формате. Однако не следует считать, что результат в точности сохраняет геометрию проекта и решения по материалам; перед сдачей его необходимо проверить.
Офисам и студентам в Турции перед началом экспериментов следует уточнить доступ к Google Cloud, этапы настройки API и актуальную стоимость использования. В источниках цены не указаны. Кроме того, наличие варианта 4K не означает, что он необходим в каждом рабочем процессе: разрешение и длительность следует выбирать с учётом целевого использования.
Частые вопросы
Можно ли создать видео из изображения с помощью Gemini Omni?
Да. Согласно документации Google, Gemini Omni позволяет создавать видео, используя существующее изображение в качестве первого кадра. Функция доступна через Media Studio или API.
Какой может быть длительность видео Gemini Omni 1.1 Flash Preview?
Согласно документации API, длительность можно задавать целым числом секунд от 3 до 10.
Какие разрешения доступны для создания видео из изображения?
Для Gemini Omni 1.1 Flash Preview перечислены варианты 360p, 720p, 1080p и 4K. Если разрешение не указано, по умолчанию используется 720p.


