Liquid AI 开放 d1-3B 和实验性的 d1-omni-600M 两个决策模型。与逐字生成回答的聊天模型不同,这类模型通过一次前向计算回答预先定义的问题,返回选择、分数或概率。适合的任务包括工单分流、紧急程度判断和图片分类,应用可以直接使用这些结果决定下一步操作。
d1-3B 来自视觉语言模型 LFM2.5-VL-3B,支持文字和图片输入;较小的 d1-omni-600M 使用编码器架构,可处理文字加图片,或文字加音频的组合。官方公布的速度测试中,d1-3B 在 Jetson AGX Thor 上单问题约十六毫秒,但这是指定测试条件下的数字,长输入与图片输入另有明显不同的耗时。
两个模型的权重已放在 Hugging Face,示例支持对同一段输入同时提出多个问题。发布方没有给实验性六亿参数版本提供速度结论,也未公布视觉与音频决策基准分数。对希望减少云端调用的团队,这次发布提供了可本地尝试的组件;它的用途是受约束的快速判断,不能直接按通用聊天模型评估。