Anthropic推出了一种更全面但价格昂贵的代码审查方式,用于审查托管存储库中的源代码,这些存储库中许多已经包含大量AI生成的代码。
Code Review是面向团队和企业客户的新服务,它部署多个智能体来全面扫描代码库,协同发现未识别的bug。
该公司的Claude模型已经能够按需进行代码审查——你可以让Claude审查自己生成的代码来了解AI生成代码的质量。这家AI公司还提供Claude Code GitHub Action,可以作为CI/CD流水线的一部分自动启动代码审查。
Code Review将执行更多此类工作,但成本更高。
"Code Review分析您的GitHub拉取请求,并在发现问题的代码行上以内联注释的形式发布发现结果,"该公司在其文档中解释道。"一群专门的智能体在您完整代码库的上下文中检查代码更改,寻找逻辑错误、安全漏洞、边界情况错误和细微的回归问题。"
一群专门的智能体?这听起来可能在推理过程中消耗大量Token。事实确实如此。正如Anthropic所观察到的,Code Review注重深度,比现有方法更加深入。
"审查按Token使用量计费,通常平均花费15-25美元,费用随拉取请求的大小和复杂性而变化,"该公司表示。
这是每个拉取请求的费用。作为比较,提供基于AI代码审查的Code Rabbit每月收费24美元。
Code Review的速度也不是很快。虽然所需时间因拉取请求的大小而异,但据Anthropic称,审查平均需要大约20分钟才能完成。
考虑到所需的时间和计费费率,问题就变成了是否支付每小时60美元让人工进行代码审查会产生相当或更好的结果。
尽管如此,这家AI公司坚持认为其工程师使用Code Review看到了积极的结果,这一发现在一些研究中得到了支持,但并非在所有情况下都如此。
Anthropic报告称,它已经在内部使用Code Review数月,取得了相当大的成功。该公司声称,对于包含超过1000行变更的大型拉取请求,84%的自动审查会发现值得注意的问题——平均发现7.5个问题。对于少于50行的小型拉取请求,31%会获得评论,平均发现0.5个问题。
人类开发者拒绝Claude发现的问题不到1%。
正在测试Code Review的客户已经看到了一些好处。当TrueNAS为其开源中间件进行ZFS加密重构时,AI审查服务发现了相邻代码中的一个bug,这个bug可能导致类型不匹配在同步操作期间擦除加密密钥缓存。
Anthropic声称,在一个涉及内部代码的实例中,Code Review捕获了对生产服务的一个看似无害的单行更改,这个更改本来会破坏服务的身份验证机制。
"它在合并前就被修复了,工程师后来分享说他们自己不会发现这个问题,"这家AI公司表示。
在大到能够负担AI工具的组织中,软件开发者再也不会独自工作了。
Q&A
Q1:Anthropic的Code Review服务是什么?它有什么功能?
A:Code Review是Anthropic面向团队和企业客户推出的新服务,它部署多个专门的智能体来全面扫描代码库,寻找逻辑错误、安全漏洞、边界情况错误和细微的回归问题,并在GitHub拉取请求中以内联注释形式提供审查结果。
Q2:使用Code Review服务需要多少费用?
A:Code Review按Token使用量计费,每个拉取请求通常平均花费15-25美元,具体费用随拉取请求的大小和复杂性而变化。审查过程平均需要大约20分钟完成。
Q3:Code Review服务的效果如何?
A:据Anthropic报告,对于超过1000行变更的大型拉取请求,84%的自动审查会发现问题,平均发现7.5个问题;对于少于50行的小型拉取请求,31%会获得评论。人类开发者拒绝Claude发现的问题不到1%,显示了较高的准确性。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。