SEO Intro

Gemini Omni 可把图像、音频和文字直接生成为视频

这篇内容主要讲什么

三年前,谷歌推出 Gemini 时,目标是构建一个多模式大型语言模型——一个接受文本、图像、音频和视频训练的单一神经网络,可以生成任何这些格式的内容。

  • 适合先看摘要,再继续查看版本变化、背景和细节
  • 发布时间:2026年5月19日
  • 作者:编辑部

文章摘要

三年前,谷歌推出 Gemini 时,目标是构建一个多模式大型语言模型——一个接受文本、图像、音频和视频训练的单一神经网络,可以生成任何这些格式的内容。

三年前,谷歌推出 Gemini 时,目标是构建一个多模式大型语言模型——一个接受文本、图像、音频和视频训练的单一神经网络,可以生成任何这些格式的内容。 今天,在 Google I/O 开发者大会上,该公司通过 Gemini Omni 向这一目标迈出了具体的一步,这是一个新的多模式模型系列,谷歌首席执行官 Sundar Pichai 表示,它将能够“根据任何输入创建任何东西”。 Omni 将从视频开始。用户现在可以组合图像、音频、视频和…

Related Articles

继续阅读相关文章

Topics & FAQ

相关专题与 FAQ

暂无内容