返回快讯列表
工具上新

Cohere 发布文档解析模型 Parse,ParseBench 均分 79.2,每千页 1.5 美元

Cohere 8 月 27 日正式发布视觉语言模型 Parse,把复杂文件转成 Markdown,官方 ParseBench 均分 79.2,8 卡 H100 节点上每秒 36 页,API 定价每千页 1.5 美元。

Cohere 8 月 27 日发布 Parse 并直接正式可用,这是一个把复杂多模态文件转成结构化输出的视觉语言模型。它不止做 OCR,还识别表格、表单、图示和内嵌图片,输出干净的 Markdown 供下游处理,并为表格和图片给出边界框。文本不给逐元素边界框,官方说这是输出格式上的取舍。

官方的 ParseBench 均分是 79.2,分项为表格 87.0、内容忠实度 86.6、语义格式 64.0。同一张表里 GPT-5.5 是 84.4,Opus 4.8 是 84.3,Gemini 3.5 Flash 是 81.8,Mistral OCR 4 是 74.5,Databricks AI Parse 是 72.4,Azure Document Intelligence 是 69.3,Google Document AI 是 57.3,AWS Textract 是 53.3。Cohere 强调的是对后两者超过 20 分的差距,排在 Parse 前面的只有前沿通用大模型。

吞吐给的是每秒 4.5 页,8 卡 H100 节点上每秒 36 页、每分钟 2160 页,用 vLLM 服务。API 定价每千页 1.5 美元。官方还算了一笔账,每月约 1300 万页的负载走 Model Vault 比走 API 每月省约 1.2 万美元,相比每千页 10 美元的超大云厂商方案每年差约 147 万美元。

渠道包括 Cohere API、Model Vault、Microsoft Foundry 和 AWS SageMaker,支持私有云和本地部署,Hugging Face 上有免费试用空间,覆盖九种主要语言。ParseBench 的版面和图表两个维度这次被排除在外,官方说不在当前产品范围内,图表数据抽取放到下一版。模型规模、架构、训练数据和页数上限都没有公布。

更多快讯