返回快讯列表
开源生态

Google 发布 EmbeddingGemma 2,把文本、代码、图像、视频和音频映射到同一向量空间

740M 参数的开放模型面向本地搜索、RAG、分类和聚类,官方提供可下载权重和多模态编码路径。

Google 在 10 月 6 日发布 EmbeddingGemma 2,一款轻量级多模态 embedding 模型。它可以把文本、代码、图片、视频和音频转换到共享向量空间,方便做跨模态搜索、RAG、分类与聚类。官方介绍模型有 740M 参数的完整版本和仅文本的更小版本,支持超过 100 种语言与 8K 上下文,权重采用 Apache 2.0。

与只处理文本的向量模型相比,EmbeddingGemma 2 可以让“图片搜音频片段”“代码和说明文档一起检索”这类任务用同一套表示空间完成。Google 给出的代码基准提升属于厂商测试,采用前要在自己的语言、数据类型和硬件上重测。

它适合放在本地或边缘设备上做第一层检索,再把少量候选交给生成模型。部署时需同时评估向量维度、索引大小、批量编码速度和敏感文件是否允许落盘;多模态支持不代表每种媒体都达到相同精度。

更多快讯