最近完整走完了一次”AI 辅助毕业论文”的全流程——从选题到初稿提交,中间踩了无数坑。把这些经验提炼成了一套方法论 + 3 个可直接运行的检测脚本,全部开源了:
先说结论:用 AI 写论文,最大的风险不是”写不出来”,而是写出来之后过不了查重、过不了 AIGC 检测、前后章节数据互相打架。
📌 五个最致命的坑
坑1:第2章(相关技术)是查重重灾区
AI 生成的技术介绍——“XX是一种基于YY的技术范式”——网上到处都是雷同表述。我的解法:调整写作顺序,先写系统实现(代码现成,查重天然低),最后写技术章节。等你把系统都做完了,这些技术已经消化了,能用自己的话重写。
推荐顺序:
1 | 第5章 系统实现 ← 第一个写(最安全) |
坑2:论文自己跟自己重复
绪论”研究内容”和各章开头天然重复 60-75%,绪论和结论重复 55-70%。这些”结构性重复”是查重率的主要来源之一,但可以免费修。
我写了个自查重脚本(jieba 分词 + TF-IDF + 余弦相似度),花钱买知网查重之前先跑一遍,能省不少冤枉钱:
1 | python3 check_plagiarism.py ~/my-thesis --glob "chapters/*.md" |
坑3:设计章和实现章贴相同代码 = 相似度100%
这是最隐蔽的查重炸弹。解法:设计章改用”方法签名表格 + 文字说明”,实现章保留完整代码。实测相似度从 100% 降到 0%。
坑4:AIGC 检测不过
“值得注意的是”、”综上所述”、”首先…其次…最后…”这些 AI 味词汇要全部清理。我做了个双模式检测脚本:有 torch 环境就用检测模型,没有就自动降级为规则评分(连接词密度、套话统计),照样能定位高风险段落:
1 | python3 check_aigc.py ~/my-thesis --glob "chapters/*.md" |
坑5:多轮修改后数据打架
这是最痛的教训:论文被多个 AI 工具轮流编辑后,绪论写”13项功能”,结论写”17项”;这章叫”管理端”,那章叫”后台系统”。答辩时老师对照着看,当场就能发现。
我写了一致性检查脚本,把互斥术语和互斥数字传进去,全文扫描:
1 | python3 check_consistency.py . --glob "*.md" \ |
还有一个铁律:代码是唯一事实来源。论文里写节点数、代码行数、模块数,必须去代码里 grep/wc 实测,绝不能凭记忆。我曾经凭印象把”11个节点”改成”10个”,后来克隆代码仓库核实——代码里就是 11 个,按代码写的才是对的。
🛠 开源了什么
| 内容 | 说明 |
|---|---|
SKILL.md |
完整方法论:写作顺序、降重策略、AIGC清理、MD→Word工作流、28条实战坑清单 |
check_plagiarism.py |
内部查重(jieba + TF-IDF + 余弦相似度) |
check_aigc.py |
AIGC检测(模型+规则双模式,自动降级) |
check_consistency.py |
术语漂移/数字矛盾检查(含跨文件预警) |
references/ |
学校要求摄入流程:官方文件→硬约束规范 |
所有脚本参数化设计,指定论文目录和文件匹配模式就能用,不绑定任何具体项目。
也可以直接装成 Claude Code Skill:
1 | git clone https://github.com/luodeCoding/ai-thesis-writing.git ~/.claude/skills/ai-thesis-writing |
🆕 更新记录
v1.3.0(2026-08-08)
- 新增文献检索与综述工作流:知网手动检索(反爬兜底)+ 知网 MCP 服务自动化检索双路径,含接入配置、GB/T 7714 格式化流程、综述三要素写法(代表性工作/对比分析/选型理由)、防 AI 编造文献红线
v1.2.0(2026-08-08)
- 一致性脚本升级:数字检查新增跨文件矛盾预警——ch01 写”46个”、ch02 写”48个”这种分散在不同文件的矛盾也会标黄提示(之前只查同一文件内)
- AIGC 脚本现在会明确提示当前是模型检测还是规则检测,不会再误以为模型已生效
- 补了
requirements.txt依赖清单;项目开始正式版本管理(CHANGELOG + Git tag + Release),后续更新都有迹可循
v1.1.0(2026-08-07)
- 新增学校要求摄入工作流:拿到学校的通知、格式规范、模板、评分标准后,先全部喂给 AI 合并生成一份
school-requirements-spec.md硬约束规范,之后写/改论文、生成 Word、提交前自查全部以它为准——不靠记忆、不靠”应该够”。这是避免”定稿后才发现格式不合格”返工的关键一步,含 PDF/doc/docx/xlsx 各格式的提取方法和规范骨架模板。
📝 28条坑里最值钱的10条
- 测试数据不能编——跑真实系统记录,编数据答辩一问就穿
- 绪论用”将要做什么”未来时态,结论用”做到了什么”+量化,才能拉开差异
- 降重时最容易术语漂移——改完必须全文 grep 验证统一
- 降重时数字最容易出错——必须回头核实源表格,不能凭印象
- 改了一章的数字,其他章引用处要同步(答辩稿、开题报告也算)
- 摘要关键词用”;”分隔,不是”、”
- 文献综述不能只罗列”XX提出了XX”,必须有对比分析和选型理由
- 近三年文献占比≥80% 这条最容易不达标,提前统计
- 多个 AI 轮流编辑会互相回退——接手先读 PLAN.md / CHANGELOG.md
- 花钱查重前先自查内部重复,内部重复往往是查重率大头
完整 28 条见仓库 SKILL.md。
💡 写在最后
AI 是写论文的效率放大器,但质量控制的责任还是在人。查重、AIGC、一致性这三道关,每一道都有工具可以提前自查,不要等到提交前才发现问题。
这套工具就是把我踩过的坑变成自动化检查——希望你不用再踩一遍。
⭐ 有用的话欢迎点 Star,也欢迎提 Issue 和 PR!
相关链接:
- GitHub:github.com/luodeCoding/ai-thesis-writing
- 我的另一篇:iOS 26/27 适配完全指南