H Company 在 9 月 3 日发布 NeoMME,一个多模态原生的多语言编码器,260M 和 800M 两档,上下文窗口都是 16384 token,全部检查点按 Apache 2.0 放出。
做法上它把文本 token 和 32×32 的原始图像块一起送进同一个双向 Transformer,从零开始用掩码离散扩散目标训练,没有沿用把预训练视觉塔接到语言模型上的路子。BPE 分词器也是从零训的,词表 131k,语料覆盖多语言文本、代码、数学和机器生成的图像转写,每个模型吃掉约 5240 亿个打包 token。微调出来的 NeoMME-Retriever 用 ColPali 的整页图像方案做视觉文档检索,一次前向同时给出稠密向量和后期交互向量。
检索成绩按 nDCG 记。260M 在 ViDoRe v3 上 0.523,v2 0.522,v1 0.860,在所有 800M 以下的模型里排第一,比参数量约 14 倍的 ColQwen2.5 只低 0.002。800M 版三项分别是 0.556、0.559 和 0.874。
效率方面,2048×2048 输入、L40S 单卡下 260M 每秒处理约 51 页,ColModernVBERT 是 26 页。分层 token 池化配上非对称量化,后期交互索引从每页约 1.5MB 压到 6KB,压缩 255 倍,nDCG@10 保住基线的 95% 以上。检查点挂在 Hugging Face 的 Hcompany 组织下,技术报告是 arXiv 2609.01657。