LightOn 10 月 8 日发布 LightOnOCR-3,提供 0.8B、1B 和 4B 三种尺寸,把文字转录与文档版面理解放在同一模型中。1B 版本沿用此前架构,0.8B 和 4B 版本采用 Qwen3.5 视觉语言架构,供开发者按精度、速度和计算资源选择。
三种模型都支持两种调用方式。使用空文本提示时,模型直接转录页面;使用 grounding 提示时,会在转录结果中增加带标签的边界框,并为图片生成描述,将图表中的数值整理为表格。坐标归一化到 0—1000,便于后续系统把内容对应回页面位置。
与分别调用文字识别、版面分割和图表提取工具相比,这种输出让文档处理流程少一些接口拼接。模型以 Apache 2.0 许可开放,可用于研究和商业场景,官方同时提供模型权重、代码仓库与在线演示。结构化结果仍来自生成式识别,复杂图表中的数字和区域边界需要按任务精度要求检查。