Reflection 在 10 月 5 日介绍首个开放权重模型 Beam。它采用稀疏混合专家架构,总参数约五千零十亿、每次激活约二百三十亿,重点处理代码、推理和 Agent 任务。官方介绍,预训练使用了二十三点八万亿 token,随后投入大规模强化学习。
当日开放的是早期体验申请,模型仍在最终红队测试与评估中。Reflection 计划在十月稍后按 Apache 2.0 发布权重,同时提供技术报告、模型卡,以及运行、评估和微调所需材料,方便开发者接到现有开源工具链。
发布页给出了多项基准结果,也承认 Kimi K3 等模型在原始能力上仍然领先。Beam 更强调推理效率:官方依据激活参数和生成 token 估算计算开销,这一估算未计入提示词预填充、随上下文变化的注意力计算和服务开销,因此与用户实际账单并不是同一个数字。