Gemini Embedding 2

Gemini Embedding 2 是 Google 的嵌入生成模型,非常适合复杂的检索和分析任务。

Gemini Embedding 2 接受多模态输入,以生成 3072 维向量。它接受图片、文本、文档、音频和视频输入,并将生成的向量在语义上映射到统一的语义空间中。这样,您就可以执行各种任务,例如根据文本说明搜索图片。

Gemini Embedding 2 引入了多项功能,可优化嵌入质量和灵活性:

  • 自定义任务指令:通过指定任务指令(例如 task:code retrievaltask:search result),针对预期关系优化嵌入,并针对特定目标检索更准确的结果。

  • 可调整的结果大小:默认情况下,模型会生成一个 3072 维的浮点矢量。不过,您可以通过指定 output_dimensionality 参数来检索维度较少的输出。

  • Document OCR:从文档输入中读取 OCR。

  • 音轨提取:从视频输入中提取音轨,并将其与视频帧交织在一起。

如需详细了解如何使用 Gemini Embedding 2,请参阅获取多模态嵌入

在 Agent Studio 中试用 部署示例应用 查看价格

注意:“部署示例应用”功能需要使用启用了结算功能和 Agent Platform API 的 Google Cloud 项目。
模型 ID gemini-embedding-2
模态
文本 仅限输入
图片 仅限输入
音频 仅限输入
视频 仅限输入
嵌入内容 仅限输出
token 数量上限 输入 token 数上限 8192
输出词元数上限 不适用
输出维度 最多 3,072 个(支持 MRL)
序列长度上限 8,192 个 token
使用选项
技术规范 文本
  • 输入 token 数量上限: 8,192
  • 每个提示的文件数量上限: 1
  • 每个文件的页数上限(对于 PDF): 6
  • 每个文件的文件大小上限: 不适用
  • 适用于扫描版 PDF 的 OCR: 默认不使用
  • 支持的 MIME 类型:
    text/plainapplication/pdf
图片
  • 每个提示的图片数量上限: 6
  • 内嵌数据或通过控制台直接上传的每个文件的文件大小上限: 无限制
  • Google Cloud Storage 中每个文件的文件大小上限: 无限制
  • 每个提示的输出图片数量上限:不适用
  • 支持的 MIME 类型:
    image/pngimage/jpegimage/webpimage/bmpimage/heicimage/heifimage/avif
视频
  • 视频时长上限(包含音频):80 秒
  • 视频时长上限(不含音频):120 秒
  • 每个提示的视频数量上限:1
  • 支持的 MIME 类型:
    video/mpegvideo/mp4
音频
  • 每个提示的音频长度上限: 180 秒
  • 每个提示的音频文件数量上限: 1
  • 支持的 MIME 类型:
    audio/mp3audio/wav
支持的区域

模型可用性

  • 全球:global
  • 美国多区域:us
  • 欧洲多区域:eu
知识截点日期 2025 年 11 月
版本
  • gemini-embedding-2
    • 发布阶段:正式版
    • 发布日期:2026 年 4 月 22 日
  • gemini-embedding-2-preview
    • 发布阶段:公开预览版
    • 发布日期:2026 年 3 月 10 日