一道由多个智能体构成的发布关卡,追问的是这次拉取请求在现实中可能弄坏什么。它不再罗列通过与否的检查,而是在接近生产环境的上下文里评估这次变更,给出 0~100 的部署信心分数,并附上一份用平白语言写成的风险说明。
起作用的,大概是它接下了现有 CI 回答不了的问题。测试的通过与否只说明有没有坏掉,而发布现场真正想知道的是此刻上线到底有多安全。0~100 的信心分数加上一份读得懂的风险说明,是可以直接拿来做判断的输出形式。从 Agentic DevOps 这一赛道的最优秀奖来看,这场比赛考的正是该把智能体放进交付流程的哪个位置。