通过双信号后训练同时约束编辑大小与正确性,在跨模型代码编辑中将不必要的差异减少约一半,同时提升构建与测试通过率。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @rohanpaul_ai当编程模型相互编辑对方的代码时,它们往往会过度修改,而这篇论文表明,针对最小正确差异进行训练比使用更严格的提示词效果更好。 使用更严格的提示词告知模型只进行最小化编辑,并不能持续解决这一问题。 研究人员转而对 Olmo3 7B 进行后训练,采用两个信号:保持编辑范围小,同时仍能通过构建和测试。CROCODIL 将来自每个模型的各实现版本的编辑距离大致减少了一半,同时在所有被测试的外部实现者上提升了构建通过率和全量测试通过率。 该研究仅限于 Rust 函数编辑。尽管如此,如果一个团队混合使用多个编程模型,应当对跨模型编辑进行基准测试,并衡量不必要的差异大小,而不仅仅关注最终代码是否通过测试。 – arxiv. org/abs/2609.03894 标题:"CROCODIL: Cross-Model Code Editing with LLMs"