固定评测协议
选定数据集版本与任务划分,固定基础模型、提示模板、工具权限和 token 预算。
SWE-bench 官方入口 ↗从理解 AI4SE,到完成一项有证据支撑的研究。
理解问题 · 复现基线 · 设计实验 · 写清贡献
沿着“代码表征 → 真实任务 → 软件智能体”的脉络阅读。
输入、输出、实际使用场景;现有方法在哪些案例上失败。
用自己的话复述关键机制,画出数据流,指出与基线的差异。
数据划分、指标、预算、消融、统计不确定性与失败案例。
一个可复现的结果、一个尚未验证的假设、一项最小实验。
先写清研究问题,再决定需要跑哪些实验。
研究假设:结合调用关系选择相关代码,可能减少无关上下文。是否有效,需要对照实验验证。
选定数据集版本与任务划分,固定基础模型、提示模板、工具权限和 token 预算。
SWE-bench 官方入口 ↗对比词法检索、向量检索和你的方法。让候选代码范围、生成次数与推理预算保持一致。
先复现,再改进RQ1:修复效果是否提高?
RQ2:哪些组件带来提升?
RQ3:成本与效果如何权衡?
记录重复运行差异、置信区间和失败类型。报告负结果,检查数据泄漏与补丁过拟合。
可复现 · 可解释| 记录项 | 具体内容 | 用途 |
|---|---|---|
| 实验身份 | 运行 ID、代码提交、依赖版本、随机种子 | 定位与重现 |
| 输入与配置 | 数据版本、模型版本、提示词、预算 | 保证公平对比 |
| 效果与成本 | 解决率、测试结果、token、耗时、费用 | 评估实际价值 |
| 过程证据 | 补丁、工具轨迹、失败日志、异常说明 | 归因与误差分析 |
选择与研究问题匹配的会议,用可核查的证据讲清贡献。
International Conference on
Software Engineering
Foundations of
Software Engineering
Automated
Software Engineering
官网入口核对于 2026-09-23。此处用于了解会议与选题;投稿日期、时区、匿名要求及论文格式请以目标届次和具体轨道的 CFP 为准。
发表取决于问题价值、方法新颖性、实验质量和评审意见。优先把研究做扎实,再根据成果成熟度选择投稿轨道。