大模型倾向保留而非删除:LLM代码编辑中的删除规避问题测量与缓解
研究发现大语言模型存在"删除规避"倾向,系统性保留本应删除的代码,导致代码库可维护性下降。在SWE-bench Verified五大模型中,删除召回率最高仅71.7%,能定位正确文件超92%,但精确删除行级代码不足52%。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
研究发现大语言模型存在"删除规避"倾向,系统性保留本应删除的代码,导致代码库可维护性下降。在SWE-bench Verified五大模型中,删除召回率最高仅71.7%,能定位正确文件超92%,但精确删除行级代码不足52%。
查看原文