微软 9 月 24 日发布开源技能 run-assert-eval,把 Clarity 威胁建模、ASSERT 行为评测和 Agent Control Specification(ACS)运行时策略接到一条工作流里。开发者描述 Agent 后,流程会先找潜在风险,再把选定风险转成可测试行为、生成策略并重新运行评测。
微软展示的账单客服 Agent 示例中,基线评测在 40 组适用对话里发现 12 次跨客户数据披露;治理后的评测在 34 组适用对话里观察到 2 次违规。微软也将“合法请求是否仍能顺利完成”单独纳入评测。
这是微软设计的示例和内部评测,样本数前后不同,不能把百分比变化当成独立对照实验。工具生成的策略仍需人工审查;其价值在于把发现风险、施加控制和复测保留在同一套流程中。