查看: 55  |  回复: 0

盈科AI

新虫 (初入文坛)

[交流] 14.6万条假参考文献:AI正在污染学术知识基础设施

如果论文里引用的文献根本不存在,那这篇论文还能算"学术成果"吗?

一、一个令人不安的数字
2026年7月,康奈尔大学的一个研究团队发表了一项分析——他们研究了大约250万篇论文、1.11亿条参考文献后,得出了一个令人不安的结论:

2025年,至少有14.6万条不存在的"幻觉参考文献"进入了学术文献。

14.6万。这不是"可能有几条",而是一个系统性的问题。

更值得注意的是,这项研究的作者里包括 Paul Ginsparg——arXiv 的创始人。连学术预印本平台的创始人都站出来关注这个问题,说明事情已经严重到什么程度了。

二、幻觉参考文献是怎么混进来的?
"幻觉参考文献"是什么?就是 AI 生成的、看起来像模像样但实际上根本不存在的文献引用。

它有几个特点:

作者名字、期刊名、年份、卷期页码,格式完全正确
标题看起来很相关,甚至和论文主题高度契合
但你去数据库里搜——根本搜不到这篇文章
这些假引用是怎么混进学术文献的?路径主要有三条:

第一条:AI 辅助写作时直接生成。 很多研究者用 AI 写论文的引言或讨论部分,AI 会自动"引用"一些看起来很相关的文献。作者可能没仔细核对,就直接留着了。

第二条:AI 润色或改写时"补充"引用。 原文本来有真实引用,但 AI 改写的时候觉得"这里再加一篇引用会更有说服力",于是凭空编了一篇。

第三条:第三方代写或降重服务。 这个就不用多说了——灰色产业链里的 AI 代写,生成的引用几乎全是假的。

不管是哪条路径,结果都一样:假文献混进了真论文,然后通过引用网络继续传播。

三、为什么这比你想的更严重
你可能会想:不就是几条假引用吗?有什么大不了的?

但实际上,这个问题的严重性被严重低估了。

第一,它会产生级联效应
学术研究是建立在前人工作基础上的。如果 A 论文引用了一篇假文献,B 论文又引用了 A 论文,C 论文再引用 B 论文……假信息就会像滚雪球一样越传越广。

而且,AI 工具在做文献综述的时候,会把这些假引用也"挖"出来,继续生成新的假内容。这就形成了一个正反馈循环:AI 生成假引用 → 假引用进入文献 → AI 又基于这些文献生成更多假引用。

第二,同行评审根本查不出来
Nature 在2026年4月就这个问题发过警告,说得很直白:现有的同行评审和编辑流程,无法充分过滤虚假参考文献。

为什么?因为审稿人不可能把每一条引用都去数据库里核对一遍。一篇论文可能有几十上百条引用,逐条查的话,审稿时间要翻好几倍。

而且假引用做得太像了——格式正确、内容相关、作者名字也像那么回事。不特意去搜,根本发现不了。

第三,它动摇了学术的根基
学术的根基是什么?是可验证性。每一个结论都应该有证据支撑,每一个引用都应该指向真实的研究。

如果引用可以是假的,那论文里说的"已有研究表明""前人发现""大量证据支持"——这些话还有多少可信度?

当读者无法信任论文的参考文献时,他们还能信任论文的结论吗?

四、目前有什么解决方案?
面对这个问题,各方都在行动,但目前还没有完美的解决方案。

出版方:加强检测和披露要求
一些期刊已经开始要求作者披露 AI 工具的使用情况,包括是否用 AI 生成了参考文献。但披露是一回事,核查是另一回事——作者说"我没用AI生成引用",编辑也没法验证。

检测工具:还不够可靠
市面上已经有一些 AI 生成内容检测工具,但它们主要检测正文,对参考文献的检测能力很有限。而且参考文献格式高度标准化,AI 生成的和人写的在统计学特征上差别不大,检测难度更高。

数据库方:可以做更多
像 PubMed、Web of Science、知网这样的文献数据库,其实有能力做交叉验证——当一篇论文提交时,系统可以自动检查每一条引用是否真实存在。

但这涉及到出版流程的改造,不是一朝一夕能实现的。

五、研究者能做什么?
在整个行业的解决方案成熟之前,研究者自己能做的其实不少:

第一,AI 生成的引用,逐条核对。 如果你用 AI 写了论文的任何部分,特别是涉及引用的部分,一定要逐条去数据库里确认。不要嫌麻烦——一条假引用可能毁掉整篇论文的信誉。

第二,用专业文献管理工具生成引用。 不要让 AI 凭空"想"引用。从 EndNote、Zotero 或文献数据库里直接导出引用格式,准确性有保障。

第三,对 AI 代写和降重服务保持警惕。 这些服务生成的内容里,假引用的比例非常高。用了这些服务,等于把论文的学术信誉交到了别人手里。

第四,投稿前做一次引用自查。 可以用文献管理工具批量导入参考文献,看看哪些匹配不上数据库。匹配不上的,大概率有问题。

六、写在最后
14.6万条假参考文献,这个数字可能还只是冰山一角。因为这项研究只分析了能检测到的部分,还有很多假引用可能藏得更深。

AI 给学术研究带来了效率的提升,这是毋庸置疑的。但它也带来了新的问题——而幻觉参考文献,可能是其中最隐蔽、也最危险的一个。

学术研究的大厦,是靠一篇篇论文、一条条引用垒起来的。如果地基里混进了假砖,整座大厦的稳定性都会受到影响。

保护学术文献的真实性,不只是期刊和出版社的事,也是每一个研究者的事。毕竟,我们每个人都是这个体系的一部分——也是它的受益者。

💡 盈科千信 ChatResearch——学术文献检索与引用生成工具。不同于通用大模型"凭空生成"引用的方式,ChatResearch 基于真实文献索引检索相关论文,每一条引用都来自实际存在的学术文献,支持一键导出标准引用格式(GB/T 7714、APA、MLA等)。从源头杜绝幻觉参考文献,让你的论文引用每一条都经得起核查。
回复此楼
已阅   回复此楼   关注TA 给TA发消息 送TA红花 TA的回帖
相关版块跳转 我要订阅楼主 盈科AI 的主题更新
普通表情 高级回复 (可上传附件)
信息提示
请填处理意见