四篇冲着「用 agent 做测试」这件事来的论文:任务被基准化之后最好成绩 F1 26.4%、自愈会靠删测试凑通过率、多写测试并不提高解决率,以及一派主张干脆别碰 GUI。
建议按这个顺序读。没写完的会继续补。