一份用于核实学术论文参考文献真实性的可复用 AI 技能包。 专门解决 AI 时代"假文献"问题,包括完全捏造、嵌合体、篡改条目三类。 v1.1+ 强化国内期刊溯源——知网 + 万方 + 维普三库命中才算 verified。
AI 帮你写论文是好事,但 AI 编的假文献是定时炸弹。
reference-test 不替你写论文、不替你做学术判断——只把你给的每一条参考文献在数据库里实地走一遍,输出一份可以人工复核的证据表。
- ✅ 多源级联验证:英文(Crossref → S2 → OpenAlex → PubMed)+ 中文(知网 cnki-mcp-server → 万方 → 维普 → 期刊官网)
- ✅ 嵌合体(chimeric)专项检测——"题真作者假"高危类型
- ✅ 国内期刊溯源:不因无 DOI 判为不可验证;CSSCI/CSCD/北大核心收录状态自动核验
- ✅ 国内期刊黑名单预警:作者占位符("刘某"等)+ 占位期刊名 + 卷期凑数
- ✅ 四级问题分级:Critical / Major / Minor / Manual Check
- ✅ 支持 8 大引用风格:APA、GB/T 7714、Vancouver、AMA、IEEE、Chicago、Harvard、Springer-Elsevier
- ✅ 离线模式:可不联网仅做格式与内部一致性
- ✅ 结构化 JSON 输出:可集成 CI / pre-commit / GitHub Actions
- ✅ MIT 协议:可商用、可二次开发
- ✅ 支持 MCP 集成:cnki-mcp-server + wanfangdata/wfdata-open-skills 可联动
reference-test-skill/
├── SKILL.md # 主技能定义(Anthropic Skill 规范)
├── README.md # 使用说明(含 FAQ)
├── TUTORIAL.md # 12 个实战教程(含 cnki-mcp-server 集成)
├── CHANGELOG.md # 更新日志
├── LICENSE # MIT 协议 + 第三方致谢
├── references/
│ ├── fake-signals.md # 假文献识别特征库(14 条启发式)
│ ├── citation-styles.md # 引用风格规则对照(8 种)
│ └── zh-cn-databases.md # 【v1.1】国内期刊溯源完整指南
└── examples/
├── sample-outputs.md # 8 个示例输入输出(含中文)
└── prompts.md # 10 个提示词模板
# 方式 A:作为完整技能包
cp -r reference-test-skill <your-agent>/skills/
# 方式 B:把 SKILL.md 内容复制到 AI 的「Custom Instructions」/「项目指令」在 AI 对话里说:
用 reference-test 核查我的参考文献:[粘贴]
或仅做中文核查:
用 reference-test 核查我的中文参考文献,配合 cnki MCP server:[粘贴]
AI 会按以下结构返回:
📋 参考文献审计报告
✅ 通过:N 条
🔴 Critical(致命):M 条 — 疑似假文献
🟠 Major(严重):P 条 — 题名/期刊明显错配
🟡 Minor(轻微):Q 条 — 格式/标点/缩写
⚪ Manual Check(人工复核):R 条 — 数据库不可达或证据不足
📊 CSSCI/CSCD 收录状态(中文适用):
→ [#][#] CSSCI 来源期刊
→ [#][#] CSCD 来源期刊
pip install cnki-mcp-server
python -m playwright install chromium// ~/.cursor/mcp.json
{
"mcpServers": {
"cnki": {
"command": "python",
"args": ["-m", "cnki_mcp"],
"env": { "NO_PROXY": "cnki.net,*.cnki.net" }
}
}
}
⚠️ NO_PROXY必须设置,否则知网 CDN(腾讯 EdgeOne)会拦截。
直接让 AI 用 WebSearch / WebFetch 拉取知网/万方/维普的搜索结果页面(适合小批量或临时使用)。
申请 APPCODE → 配置 → 自动调用 REST API。个人可申请,1–3 工作日审批。
完整对比与故障排查:见 references/zh-cn-databases.md。
- 🎓 研究生 / 青年学者:投稿前自查
- 📚 综述作者:几十上百条文献的批量核查
- 🏥 生物医学方向:PMID 专项核查
- 🤖 所有用 AI 写作的人:自查 AI 是否编造了文献
- 📝 中文核心 / CSSCI / CSCD 投稿:国内期刊专项,三库命中才算 verified
- 🏛️ 编辑部 / 课题组:投稿前质控
- 📦 文献管理软件用户:EndNote/Zotero 导出后质控
宁可严格标记可疑问题,也不要把无法确认的参考文献默认为正确。
A:能。 reference-test 走知网 + 万方 + 维普 + 期刊官网溯源链,绝不因无 DOI 判为不可验证。但要严格判定"是否真实",需要至少两库命中。
A:CNKI 用腾讯 EdgeOne CDN 反爬。 必须设置 NO_PROXY=cnki.net,*.cnki.net 让 CNKI 走本地直连。如果在云端部署,可能需要更换 IP 或换 cnki-mcp-server 之外的方案(WebFetch 公开页面)。
A:
- 个人访问 https://apps.wanfangdata.com.cn/open 注册
- 申请 APPCODE(1–3 工作日)
- 在配置中设置环境变量
WANFANG_APPCODE=<your-code>
A:典型特征包括:
- 期刊名占位符:"中国科技信息"、"科技创新导报"、"民营科技"等多所高校已列入黑名单的期刊
- 作者占位符:"刘某"、"王某"、"张某等"
- 卷期页凑数:Vol. 999、期号超刊频率、页码跨度小
- 中英文题名互译不对
reference-test 自动检测这些模式并标记为 Critical / Major。
A:
- CSSCI:https://cssci.nju.edu.cn(每两年更新)
- CSCD:http://www.cscd.cn(每年更新)
- 北大核心:北京大学出版社,最新版为 2023 版
reference-test 通过知网期刊详情页 + WebFetch 三官网综合判断。
A: 设置 PLAYWRIGHT_HOST_PLATFORM_OVERRIDE=ubuntu24.04-x64 再 python -m playwright install chromium。
A: 本技能内置 PDF 文本提取对扫描版无效——建议先用 OCR(如百度网盘 OCR、Adobe Acrobat、ABBYY)。如不想做 OCR,可走 Manual Check 流程。
A:不行。 通用 AI 没有联网能力,只能基于训练数据"凭印象判断",经常给出错误的"看起来通过"。本技能的核心差异就是强制联网验证。
MIT — 详见 LICENSE 文件。
欢迎提 Issue / PR,特别是:
- 新型 hallucinated citation 的检测规则
- 中文学位论文/会议论文溯源的最佳实践
- 国内期刊黑名单更新:更多被剔除期刊的清单
- 已知的高仿真假文献样本(用于回归测试)
相关资料:
- Nature 报道:"Hallucinated citations are polluting the scientific literature" (2026/04)
- CheckIfExist 论文:arXiv 2602.15871
- PHY041/claude-skill-citation-checker 等开源工具
- cnki-mcp-server:https://github.com/xxxxchaos/cnki-mcp-server
- wanfangdata/wfdata-open-skills:万方开放技能