Google представила Gemini Omni: мультимодальную нейросеть для генерации и редактирования видео
В рамках ежегодной конференции I/O компания Google анонсировала свой новейший продукт в сфере искусственного интеллекта — Gemini Omni. В отличие от существующих узкоспециализированных инструментов, таких как Veo, новая модель способна обрабатывать практически любые типы входных данных для создания максимально реалистичного видеоконтента.
Система построена на архитектуре Gemini и представляет собой полноценную мультимодальную среду. Это позволяет генерировать ролики на основе текстовых описаний, статических изображений или уже существующих видеофайлов. На текущем этапе пользователям доступно создание видео из вышеперечисленных форматов, а в будущих обновлениях разработчики планируют добавить возможность генерации отдельных изображений и текстов внутри самой системы.
Технологические особенности и моделирование реальности
Благодаря интеграции интеллектуальных алгоритмов Gemini, модель Omni интерпретирует сложные запросы и создает логически выверенный контент. В Google называют новинку «следующим большим шагом» на пути к созданию ИИ, способного моделировать и симулировать физический мир. Нейросеть демонстрирует продвинутые способности к логическим рассуждениям и глубокое понимание законов физики, что позволяет добиваться высокой степени реалистичности в итоговых видео.
Инструменты редактирования и безопасность
Одной из ключевых особенностей Omni стали расширенные возможности видеомонтажа. Пользователи могут загружать готовые ролики обратно в систему и вносить в них изменения с помощью простых текстовых команд. Технология позволяет не просто корректировать видео, но и полностью заменять отдельные объекты или элементы окружения, что ранее требовало сложной профессиональной обработки.
Для предотвращения распространения дезинформации Google внедрила ряд защитных мер:
- Автоматическое добавление цифровых водяных знаков SynthID во все выходные файлы.
- Маркировка контента, позволяющая идентифицировать вмешательство искусственного интеллекта.
- Система фильтрации контента для предотвращения создания нежелательных материалов.
Доступность и форматы подписки
Смотрите также:
Актуальный ответ на Wordle: Подсказки и решение головоломки дня http://kupidonchik.org/aktualnyiy-otvet-na-wordle-podskazki-i-reshenie-golovolomki-dnya/.
Интересности на тему: Google внедряет функцию интеллектуальных вопросов к веб-страницам в поиске на Android
Классные советы в статье "Интеграция Gemini и Canva: искусственный интеллект упрощает создание редактируемых макетов" здесь.
Инструмент Gemini Omni будет интегрирован в экосистему Google через несколько каналов доступа. Обновленное мобильное приложение позволит добавлять шаблоны генерации непосредственно в галерею устройства. Кроме того, пользователи смогут создавать персонализированные аватары, в точности копирующие внешность и голос владельца, для их последующего использования в видеороликах.
Процесс внедрения технологии будет проходить поэтапно:
- Платные подписчики получат доступ к Omni через сервисы Google Flow и YouTube Shorts.
- Разработчики и корпоративные клиенты смогут использовать возможности модели через API в ближайшие недели.
- На старте будет доступна версия Omni Flash, а в будущем компания планирует выпустить более мощную модификацию — Omni Pro.




