之前发过一篇《用AI写毕业论文的完整踩坑实录》,讲的是查重、AIGC 检测这些”业务坑”。这篇换个角度:一个完整论文周期跑下来,我对 AI Agent 协作本身学到的几堂课——这些经验不只适用于写论文,做任何 AI 辅助的长周期项目都用得上。
对应的工具箱已开源:github.com/luodeCoding/ai-thesis-writing
第一课:多 Agent 轮流编辑,会互相”回退”
论文这种长周期项目,不可能只用一个 AI:这个模型写初稿便宜,那个模型改格式细心。问题来了——后一个 Agent 不知道前一个改了什么,会把它认为”不对”的地方改回去。
真实事故:Agent A 把节点数从代码里核实后改成 11 个;第二天 Agent B 凭”印象”觉得不对,又改回 10 个。
解法:给 Agent 们建”交接班”机制。
1 | PLAN.md → 唯一权威进度文件(时间线 + 任务清单 + 质量指标) |
规矩只有一条:任何 Agent 接手前必须先读这两个文件,改完必须更新它们。 没有记忆文件的 Agent,每天都是第一天上班的实习生。
第二课:数据类修改,必须有”可验证来源”
Agent(和人一样)会凭感觉写数字。”13 项功能”还是”17 项”?它上次说是 13,这次可能就写 17。
定的铁律是:论文里所有数字,必须能回溯到代码或源表格。 不确定就现场验证:
1 | grep add_node src/agents/*.py | wc -l # 节点数,以代码为准 |
代码是唯一事实来源,论文描述与代码不一致时改论文,不改代码。
配套做法:写一个一致性检查脚本,把互斥术语组、互斥数字组传进去全文扫描,降重改写后必跑:
1 | python3 check_consistency.py . --glob "*.md" \ |
第三课:把”学校要求”做成 Agent 的硬约束输入
这是花最多返工成本换来的经验。学校发的格式规范散落在通知、模板、评分表好几个文件里,Agent 不知道,写出来的东西格式全错,定稿后返工。
解法是一个”摄入工作流”:**先把所有官方文件喂给 AI,合并生成一份 school-requirements-spec.md**:
- 归档:学校文件原件放
school-docs/,只读不动 - 提取:PDF 用 pymupdf(图片型 PDF 提图给视觉模型读)、.doc 用 textutil、.docx 用 python-docx
- 生成规范:数字保留原文、写成”必须/不得/≥/≤”的硬约束、按主题分章
- 使用协议:写/改论文前必须加载它;学校发新通知,先更新它再动笔
本质上这就是现在流行的 context engineering:Agent 的输出质量上限,取决于你喂给它的约束质量。
第四课:让 Agent 自查,比人盯有效
论文有三道关:查重、AIGC 检测、一致性。每一道都让 Agent 先自查一遍:
- 内部查重:jieba 分词 + TF-IDF + 余弦相似度,查出绪论和结论重复 60% 这类结构性问题
- AIGC 检测:双模式——有模型环境用检测模型,没有就降级为规则模式(AI 味关键词密度评分)
- 一致性:术语漂移、数字矛盾扫描
Agent 生成 → 脚本检测 → Agent 修复 → 再检测,这个闭环跑几轮,比人逐段盯效率高得多。
第五课:Agent 协作也要有”门禁”
收尾阶段最容易出的问题是:Agent 为了”显得有产出”,硬找毛病制造新改动。定的规矩是:
- 正文达标后只做回归验证 + 口径核对,不做新改动
- 问题分级:🔴 必须修 / 🟠 应该修 / 🟡 可以改,🔴 清零才准交付
- 提交前把老师通知拆成硬指标,逐条对照实测,输出对照表——不凭”应该够”下结论
写在最后
这五堂课其实是一句话:把 Agent 当团队管,而不是当工具用。 工具用完就丢,团队需要交接文档、事实来源、输入约束、自查闭环和交付门禁。
所有方法论和脚本都在仓库里:ai-thesis-writing,当前 v1.2.0,欢迎 Star。
相关链接:
- 上一篇:用AI写毕业论文的完整踩坑实录
- 相关:公司级iOS项目迭代开发SOP
- 相关:个人iOS独立开发SOP