固定评测协议
选定数据集版本与任务划分,固定基础模型、提示模板、工具权限和 token 预算。
SWE-bench 官方入口 ↗2026.09 — 2027.09 · 冲刺一篇软件工程顶会主会研究论文录用。
主线:仓库级程序修复 · 测试反馈 · 上下文选择
阅读第 1 讲,选一个软件任务,写清输入、输出、评价指标。今天的完成标准是一页产出。
软件工程本科、算法竞赛;Qwen SFT / DPO、Decoder-Only、CLIP + Mamba 检索项目经验。跳过大段神经网络入门复习,用已有训练与检索经验理解实验。
你最近在学生命周期、SRS、UML、敏捷与 Scrum。把概念落实到 Git、测试、仓库定位与复现;再补论文问题定义和实证方法。
以已有 RTX 4090 24GB 为基础,先做不训练的推理与检索实验。具体模型是否能跑取决于量化、上下文和并发,先实测显存;API 费用另行预算。
默认每周 20 小时;每周至少保留编码、阅读、实验分析与写作。每两周找导师或同伴讨论一次,第 4 月前收敛单一问题。
沿着“综述 → 评测 → 阶段式基线 → 软件 Agent”阅读;每篇都交一份产出。
输入、输出、实际使用场景;现有方法在哪些案例上失败。
用自己的话复述关键机制,画出数据流,指出与基线的差异。
数据划分、指标、预算、消融、统计不确定性与失败案例。
一个可复现的结果、一个尚未验证的假设、一项最小实验。
先写清研究问题,再决定需要跑哪些实验。
候选假设:将允许使用的失败测试反馈映射到相关函数,可能减少无关上下文。先查重、再做 pilot;没有预设正结果。
选定数据集版本与任务划分,固定基础模型、提示模板、工具权限和 token 预算。
SWE-bench 官方入口 ↗对比词法检索、向量检索和你的方法。让候选代码范围、生成次数与推理预算保持一致。
先复现,再改进RQ1:修复效果是否提高?
RQ2:哪些组件带来提升?
RQ3:成本与效果如何权衡?
记录重复运行差异、置信区间和失败类型。报告负结果,检查数据泄漏与补丁过拟合。
可复现 · 可解释| 记录项 | 具体内容 | 用途 |
|---|---|---|
| 实验身份 | 运行 ID、代码提交、依赖版本、随机种子 | 定位与重现 |
| 输入与配置 | 数据版本、模型版本、提示词、预算 | 保证公平对比 |
| 效果与成本 | 解决率、测试结果、token、耗时、费用 | 评估实际价值 |
| 过程证据 | 补丁、工具轨迹、失败日志、异常说明 | 归因与误差分析 |
先做 1 个任务,再做固定 10–20 个开发任务。数据版本、任务 ID、仓库版本和预算先写入配置。用开发集调试,正式测试集冻结后不得反复挑方法。
比较:固定上下文、词法检索、向量检索、同预算的 Agentless / Agent 基线、你的候选方法。训练、采样次数和基础模型若有差别必须单独解释。
主指标:解决任务数 / 固定任务总数;另报定位命中、token、墙钟耗时、费用和环境失败率。改进以百分点及配对差异报告,并说明不确定性。
停止条件:两轮开发试验仍无稳定、可解释收益,就检查瓶颈或缩小问题。人工提供的正确位置只能作为上界诊断,不可当作自动方法结果。
选择与研究问题匹配的会议,用可核查的证据讲清贡献。
International Conference on
Software Engineering
Foundations of
Software Engineering
Automated
Software Engineering
官网入口核对于 2026-09-23。此处用于了解会议与选题;投稿日期、时区、匿名要求及论文格式请以目标届次和具体轨道的 CFP 为准。
这里的目标按主会 Research Track 研究论文规划。Workshop、Demo、NIER 等可以提供交流与反馈,但不能直接当作同等的主会长文目标。
FSE 后续窗口从 官方系列页核对;ASE 后续窗口从 官方系列页核对。本站不推测未核实的截止时间。
每月检查一次 CFP:摘要/全文截止、时区、匿名、篇幅、artifact 与 AI 使用政策。时间表中的月份均为内部计划,不是会议承诺。
第 9–10 月争取首投,第 11–12 月预留回应与修改。录用和正式发表可能晚于一年;没有正结果时应缩小或调整问题,不能用重复投稿赶进度。
8 份中文讲义 · 概念解释、具体示例、动手练习与自查答案。