Fireworks Research 发布 Ember-1,定位为基于 Kimi K3 训练出的专用模型,目标是保留任务质量,同时缩短不必要的推理轨迹。公司称,在两家客户的生产编码流量 A/B 测试中,Ember-1 每个任务的 token 数减少约 35%,其中一组记录到总 token 减少 39%。
Fireworks 还在 Doximity 的 Bedside Bench 和多个编码、工具调用基准上做了比较,并把 Ember-1 作为 Serverless Research Preview 提供。测试、生产 A/B 和成本计算均来自 Fireworks 自测或客户案例,不能直接推导所有任务都会节省同样比例。
这个模型的切口是“少想一些但保持结果”,适合高频 Agent 调用和预算敏感的场景。接入前仍应使用自己的工具链测试失败重试、长任务稳定性和输出质量,避免只看 token 账单。