Google представила Gemini Omni: мультимодальную нейросеть для генерации и редактирования видео

Google представила Gemini Omni: мультимодальную нейросеть для генерации и редактирования видео

В рамках ежегодной конференции I/O компания Google анонсировала свой новейший продукт в сфере искусственного интеллекта — Gemini Omni. В отличие от существующих узкоспециализированных инструментов, таких как Veo, новая модель способна обрабатывать практически любые типы входных данных для создания максимально реалистичного видеоконтента.

Система построена на архитектуре Gemini и представляет собой полноценную мультимодальную среду. Это позволяет генерировать ролики на основе текстовых описаний, статических изображений или уже существующих видеофайлов. На текущем этапе пользователям доступно создание видео из вышеперечисленных форматов, а в будущих обновлениях разработчики планируют добавить возможность генерации отдельных изображений и текстов внутри самой системы.

Технологические особенности и моделирование реальности

Благодаря интеграции интеллектуальных алгоритмов Gemini, модель Omni интерпретирует сложные запросы и создает логически выверенный контент. В Google называют новинку «следующим большим шагом» на пути к созданию ИИ, способного моделировать и симулировать физический мир. Нейросеть демонстрирует продвинутые способности к логическим рассуждениям и глубокое понимание законов физики, что позволяет добиваться высокой степени реалистичности в итоговых видео.

Инструменты редактирования и безопасность

Одной из ключевых особенностей Omni стали расширенные возможности видеомонтажа. Пользователи могут загружать готовые ролики обратно в систему и вносить в них изменения с помощью простых текстовых команд. Технология позволяет не просто корректировать видео, но и полностью заменять отдельные объекты или элементы окружения, что ранее требовало сложной профессиональной обработки.

Для предотвращения распространения дезинформации Google внедрила ряд защитных мер:

  • Автоматическое добавление цифровых водяных знаков SynthID во все выходные файлы.
  • Маркировка контента, позволяющая идентифицировать вмешательство искусственного интеллекта.
  • Система фильтрации контента для предотвращения создания нежелательных материалов.

Доступность и форматы подписки

Смотрите также:

Актуальный ответ на Wordle: Подсказки и решение головоломки дня http://kupidonchik.org/aktualnyiy-otvet-na-wordle-podskazki-i-reshenie-golovolomki-dnya/.

Интересности на тему: Google внедряет функцию интеллектуальных вопросов к веб-страницам в поиске на Android

Классные советы в статье "Интеграция Gemini и Canva: искусственный интеллект упрощает создание редактируемых макетов" здесь.

Инструмент Gemini Omni будет интегрирован в экосистему Google через несколько каналов доступа. Обновленное мобильное приложение позволит добавлять шаблоны генерации непосредственно в галерею устройства. Кроме того, пользователи смогут создавать персонализированные аватары, в точности копирующие внешность и голос владельца, для их последующего использования в видеороликах.

Процесс внедрения технологии будет проходить поэтапно:

  • Платные подписчики получат доступ к Omni через сервисы Google Flow и YouTube Shorts.
  • Разработчики и корпоративные клиенты смогут использовать возможности модели через API в ближайшие недели.
  • На старте будет доступна версия Omni Flash, а в будущем компания планирует выпустить более мощную модификацию — Omni Pro.