智能体

Yandex内部部署NeuroReview AI代码评审系统 每日处理4000个合并请求

2026年10月10日 · 阅读 1 分钟

turned on MacBook Pro on gray surface
Ben Kolde / Unsplash

Yandex基础设施团队已在内部部署一款名为NeuroReview的AI代码评审系统,该系统每天处理约4000个合并请求,占雅尔卡迪亚(Yarcadia)内部所有开发合并请求的约40%。该系统旨在帮助开发人员提前发现潜在缺陷,尤其是那些无法通过编译、测试或静态分析工具检测到的逻辑错误。

NeuroReview构建于Yandex自主研发的Comrade平台之上,后者用于运行大型语言模型代理。整个评审流程通过Temporal工作流引擎进行编排,包括上下文收集、代理执行、技术验证和评论发布等阶段。系统采用双代理架构:第一代理为生成器,负责读取代码差异并尽可能多地识别潜在问题;第二代理为验证器,负责过滤无效或重复的评论,提高最终反馈的准确性。

在生产环境中,NeuroReview使用Qwen 3.6 27B作为生成模型,MiniMax-M2-7作为验证模型。团队曾尝试使用单一代理完成评审任务,但效果不佳:要么过于保守,错过潜在缺陷,要么生成过多噪音。随后转采用双代理架构后,效果有所提升。

为评估不同配置方案的效果,团队引入了Time Saved per PR (TSPR)指标,用于衡量每份合并请求节省的工程时间。实验结果显示,基于Opus模型的配置相比Qwen提升了约30%的TSPR,但单次调用成本高达3.42美元,远高于Qwen的0.041美元。考虑到每日处理上千个合并请求以及可能的重复检查,团队最终选择以性价比更高的Qwen作为生产环境的主要模型。