Gemini Omni Flash — видеомодель Google на NetRoom
← В блог
НОВОСТИ 22 июля 2026 г. 6 мин чтения

Gemini Omni Flash: видео со звуком и правками по диалогу — уже на NetRoom

Google выпустила Gemini Omni Flash — преемника Veo 3.1: ролики до 10 секунд в 720p с нативным звуком, фото-в-видео по референсам и правки диалогом. На NetRoom — около 10,9 рубля за секунду.

Коротко

30 июня 2026 года Google открыла разработчикам доступ к Gemini Omni Flash — первой модели нового семейства Gemini Omni, отвечающего за генерацию и редактирование видео. Пользователи приложения Gemini увидели её раньше: консьюмерский запуск прошёл на Google I/O 19 мая, где модель заменила Veo 3.1. Gemini Omni Flash делает ролики длиной от 3 до 10 секунд в 720p с нативным звуком, собирает видео из фотографий-референсов и — главное — умеет править уже готовый ролик в диалоге, без пересоздания с нуля. На NetRoom модель уже подключена: страница — Gemini Omni Flash, цена — около 10,9 рубля за секунду видео.

Что это за модель

Omni — новое семейство видеомоделей Google DeepMind, и Flash в нём первая. От линейки Veo она отличается подходом: Veo генерировала ролик по промпту, и если результат не устраивал, приходилось переписывать промпт и запускать генерацию заново. Omni Flash задумана как разговорная модель: первый результат — это черновик, который дальше доводится репликами. Попросили — она поменяла свет, добавила дождь, приблизила камеру, заменила фон, а остальное оставила как было.

Модель принимает на вход текст, изображения и видео, поэтому один и тот же инструмент закрывает сразу несколько задач: генерацию с нуля, оживление фотографий, переработку существующих роликов и итеративные правки.

Характеристики

  • Длительность — от 3 до 10 секунд, по умолчанию 8.
  • Разрешение — 720p, горизонтальный формат 16:9 и вертикальный 9:16 для Shorts и Reels.
  • Звук генерируется всегда: реплики персонажей, фоновый шум, эффекты. Отдельно включать его не нужно — и выключить тоже нельзя, это часть модели.
  • Форматы на выходе — MP4, WEBM и MOV.
  • До четырёх вариантов ролика за один запрос — удобно, чтобы выбрать лучший дубль.

Четыре режима работы

Текст в видео

Классический режим: описываете сцену словами — получаете ролик со звуком. Работает и с диалогами: если в промпте есть прямая речь, персонажи её проговорят.

Фото в видео

Два варианта. Первый — задать стартовый кадр: модель оживит фотографию и продолжит движение. Второй — референсы: загружаете до семи изображений (персонаж, товар, локация, стиль), и модель соберёт сцену с этими объектами. Это рабочий способ удержать одного и того же героя или продукт в серии роликов.

Видео в видео

Загружаете собственный ролик и описываете, что поменять: перекрасить объект, заменить фон, поменять погоду или время суток. Модель перерабатывает исходник, сохраняя композицию кадра.

Multi-turn: правки диалогом

Главная фича модели. Каждая генерация получает свой идентификатор, и следующий запрос можно адресовать к ней: «теперь ближе камеру и добавь туман» — и модель правит именно этот ролик, а не генерирует новый по мотивам. Итераций может быть несколько подряд, как в обычном чате. Для рабочих задач это меняет экономику: вместо пяти полных генераций «вслепую» — одна генерация и несколько точечных правок.

Кому это пригодится

Десять секунд со звуком — это формат короткой рекламы, продуктовой заставки и вертикального ролика для соцсетей. Несколько сценариев, где связка режимов работает особенно хорошо:

  • Карточки товаров и промо. Загружаете несколько фото товара как референсы — получаете живой ролик с тем же самым товаром, а не с похожим. Не понравился фон — правите репликой, без повторной генерации с нуля.
  • Вертикальный контент. Формат 9:16 с готовым звуком закрывает Shorts, Reels и клипы для ВК: озвучивать и накладывать шумы отдельно не нужно.
  • Сторибординг и превиз. Режиссёру или дизайнеру проще показать заказчику десятисекундный черновик сцены, чем описывать её словами. Правки по ходу обсуждения вносятся прямо в диалоге.
  • Оживление архива. Старые фотографии и статичные баннеры превращаются в короткие анимированные ролики по одному стартовому кадру.

Единственное жёсткое ограничение, о котором стоит помнить, — 720p: для большого экрана и презентаций высокого разрешения модель пока не вариант, её стихия — веб и мобильные ленты.

Сколько стоит

На NetRoom всё считается по секундам: около 10,9 рубля за секунду готового 720p-видео со звуком. Восьмисекундный ролик по умолчанию обойдётся примерно в 88 рублей, максимальные десять секунд — около 109 рублей. Оплата с баланса, списывается только за фактически сгенерированные секунды.

Как попробовать

Модель уже работает: откройте страницу Gemini Omni Flash или выберите её в списке видеомоделей в чате NetRoom. Дальше — как обычно: пишете промпт или прикладываете фото, выбираете длительность и формат кадра, ждёте генерацию. Никакого VPN, зарубежной карты и подписки Google AI не нужно — пополняете баланс в рублях и генерируете из браузера.

Как и остальные видеомодели Google, ролики маркируются невидимым водяным знаком SynthID — на глаз он не заметен и на качество не влияет.

Если вы уже работали с Veo 3.1 на NetRoom, самый быстрый способ почувствовать разницу — сгенерировать ролик и тут же попросить модель что-нибудь в нём поменять. Именно в этой связке «генерация плюс правки» Omni Flash сильнее всего.

Попробовать все нейросети на одном балансе

Текст, изображения, видео и звук — один кабинет NetRoom вместо десятка подписок.

Начать бесплатно

Ещё в блоге

НОВОСТИ
7 сентября 2026 г. 8 мин чтения

Девять моделей в каталоге: видео до 4K, апскейл, голоса и GPT-6

Шесть видеомоделей, голосовой синтез и два GPT-6. Omni Flash обновился до 1.1 с 4K и продлением сцены, появился апскейлер готового видео, а Fish Audio клонирует голос по одному образцу.

NR
NetRoom
РЕДАКЦИЯ, NETROOM
НОВОСТИ
18 августа 2026 г. 7 мин чтения

Gemini 3.7 Flash в каталоге и первое время вдвое дешевле

Свежая модель Google с контекстом на миллион токенов и мультимодальным входом. Первое время стоит вдвое меньше обычного. Gemini 3.6 Flash с витрины убрали.

NR
NetRoom
РЕДАКЦИЯ, NETROOM
НОВОСТИ
11 августа 2026 г. 6 мин чтения

В каталог приехали пять моделей: картинки с текстом и видео со звуком

Три модели для картинок и две для видео с нативным звуком. Qwen уверенно рисует кириллицу, Seedance держит ролик до 30 секунд, FLUX 3 Video монтирует склейки внутри одной генерации.

NR
NetRoom
РЕДАКЦИЯ, NETROOM