基于约250万篇生物医学论文筛查发现,AI引文造假率三年飙升超12倍,2026年初达每万篇56.9条。虚假文献格式规范难以识别,综述类论文造假率高出57%。研究呼吁将自动化引文核验纳入投稿流程,防止学术文献被不可逆污染。
2026年5月,《柳叶刀》上的一篇通讯文章,在国内医学科研圈激起了不小的波澜。这篇文章聚焦于一个令人不安的现象——AI引文造假。

长期稳定更新的攒劲资源: >>>点此立即查看<<<
研究团队基于PubMed Central中约250万篇生物医学论文进行了系统性筛查,结果发现,过去几年间,参考文献的造假率飙升了超过12倍。具体来说,2023年每万篇论文中大约会出现4条伪造的参考文献,而到了2026年初,这个数字已经攀升至每万篇56.9条。
这项研究的牵头人Maxim Topaz,是哥伦比亚大学护理学院的副教授,同时也是一位资深的医疗AI研究员,更是全球前2%的顶尖科学家。有意思的是,即便是这位常年与AI打交道的专家,也曾在撰写评论时,被一篇AI生成的虚假文献打了个“措手不及”。
那么,面对这一切,我们究竟能做些什么?带着这些疑问,我们专访了Maxim Topaz。
这项研究的起源,恰恰是Topaz本人一次令人警醒的亲身经历。当时,他正借助AI聊天工具为一篇评论润色。作为AI研究者,他自然清楚AI存在“幻觉”问题,于是特意核对了所有引文,确保万无一失。然而,即便经过了多轮修改与自查,期刊编辑还是对其中一篇参考文献提出了质疑——原来,AI工具悄悄“塞”进了一条完全虚假的文献,而他之前的核查竟未能发现。
这件事让Topaz深受触动。他意识到,比失误本身更值得警惕的,是背后的深层隐患:连常年与AI打交道的专业人士都会“中招”,普通研究者自然更难幸免。于是,一个调研的想法开始萌芽。
在此之前,从未有人统计过虚假引文最终进入经过同行评审、正式发表论文的比例,而参考文献恰恰是整个科学体系的根基。一旦引文失去可信度,整个科研大厦都会摇摇欲坠。Topaz的团队正是为了填补这一研究空白,开展了此次大规模调研。
说到这次研究的成功,离不开Topaz独特的跨学科背景。他同时任职于哥伦比亚大学护理学院与数据科学研究所,这种双重身份起到了关键作用。临床医学知识能帮助团队判断哪些问题会造成实际影响,并掌握不同细分领域正规引文的特征,从而区分普通引文错误和恶意造假;而数据科学技术则让大规模自动化核验成为可能,彻底摆脱了人工核查的局限。
研发过程中,最大的技术难题莫过于误判。面对海量参考文献,即使系统的误判率极低,也会产生海量的错误预警信息。核心挑战在于,如何精准区分蓄意造假、无心笔误,以及标题简写等正常格式问题。为此,团队搭建了一个多层级核验流程,其中包含大语言模型的初筛环节,并邀请了独立的人工审核人员对结果进行校验。最终,系统的准确率达到了91%。可以说,在海量数据下打造一套可靠、可信的核验系统,是整个项目最难攻克的一关。
这次核查覆盖了约250万篇生物医学论文、1.25亿条参考文献,之所以选择如此大规模的分析,是因为单篇论文的引文造假发生率本身偏低,仅凭个别案例无法得出可靠结论。团队一共核查了2471758篇开放获取论文、超过1.25亿条参考文献,只有这样,才能统计出造假问题的整体发生率,更重要的是梳理出其长期变化趋势。
结果令人震惊。业内过往的认知与现实情况相差极大。此前,大家普遍认为引文造假只是个别作者品行不端,或是写作疏忽导致的小众问题。但数据显示,虚假引文如今已遍布各类生物医学文献。自2023年至今,引文造假率涨幅超过12倍。更令人担忧的是,在本次核查开展时,98.4%存在造假引文的论文既未被更正,也未被撤稿。简而言之,这一问题的严重程度和整改滞后性,都远远超出了行业以往的判断。
那么,为什么引文造假率从2024年年中开始急剧攀升?时间节点很有指向性。大型语言模型在2022年末至2023年开始全面普及,而生物医学论文从投稿到发表通常需要100天到200天。因此,借助AI辅助撰写的论文,从2024年年中起开始大量出现在美国国立医学图书馆的数据库中。这也恰好是造假率骤增的转折点。
需要说明的是,本次研究仅证实了问题的存在,并未直接界定成因。论文代写产业的泛滥、期刊索引规则与评审机制的变化,同样推高了造假比例,且各类因素相互叠加。正是由于期刊缺乏有效的核验环节,AI生成或代写产业链产出的虚假引文才得以顺利发表。因此,无法将问题归咎于单一原因。客观来看,AI让编造引文变得轻而易举,而现行的审核机制原本就没有针对这类造假设计排查手段。
与以往人为编造的引文相比,AI生成的虚假引文有着本质区别。过去的引文问题多是粗心导致的疏漏,比如页码写错、文献观点引用有误,但被引用的文章本身是真实存在的。而如今,AI生成的引文对应的文献完全是子虚乌有。这些假引文格式规范,署上真实且业内知名的研究者姓名,贴合论文主题,发表日期也设置得合情合理,足以蒙混过初步检查,常规的同行评审也往往难以识破。
其深远危害在于,引文本是科研人员验证研究结论的核心依据,如今大规模造假已成现实。问题从“引文内容有误”演变为“引用文献根本不存在”,这不再是证据质量下降,而是直接切断了科学论证的证据链。
在核查过程中,Topaz团队发现过一些极端的案例。比如,2025年某开放获取肿瘤学期刊上的一篇论文,聚焦细分外科领域。在该论文经核验的30条参考文献中,有18条为造假内容。这些假引文精准匹配论文研究方向,作者均为该领域真实专家,发表时间也集中在2023年至2024年。
还有一个现象同样值得警惕。在某期刊一年内刊发的11篇论文中,反复出现两位相同署名的作者。这些论文包含15条虚假引文,且涉及多个互不相关的前沿研究领域。比起单篇问题论文,这种批量造假的现象更令人担忧。更让人不安的是,这些问题论文一直留在公开文献库中,还会被其他论文继续引用,却没有任何标注警示、更正说明,行业也未对此提出质疑。
一个特别值得关注的趋势是,综述类论文的引文造假率比其他类型论文高出约57%,而综述又是临床诊疗指南的制定基础。为什么综述类论文尤其容易遭到AI驱动的引文造假侵袭?多重因素叠加,让综述类论文成为造假重灾区。首先,综述的参考文献列表篇幅更长,虚假引文更容易浑水摸鱼;其次,撰写综述需要梳理、归纳大量文献,这也是研究者最常借助AI辅助的环节,而这种工作场景恰恰极易催生虚假引文。
此外,综述处于整个科研证据链的上游,各类系统评价依托综述撰写,临床诊疗指南又以系统评价为依据。数据显示,综述类论文每万篇的引文造假数为16.7条,其他类型论文为10.6条。这约57%的差距带来的危害远比数字本身更大,综述中的造假内容不会止步于此,还会层层传导,最终影响临床医生和政策制定者依赖的核心证据体系。
虚假引文会如何误导临床决策、威胁患者安全?医学界是否低估了这类现实风险?答案显而易见。虚假引文会沿着完整的证据链产生负面影响。临床诊疗指南依托系统评价制定,目前已有证据证实,部分代写论文已被纳入撰写指南所用的系统评价中。如果一份指南引用的论文本身含有大量虚假引文,那么其提出的治疗方案就失去了应有的科学支撑。
需要明确的是,研究团队并未追踪患者的实际诊疗结果,因此无法量化虚假引文直接造成的医疗伤害,也不会妄下此类论断。但现有科研证据体系存在结构性风险,且这一风险确实被医学界低估了。已有系统评价发现,医学论文中约四分之一的参考文献存在各类错误,这足以说明,参考文献核验并非同行评审的常规环节。连普通的引文错误都无法全面排查,想要识破精心伪装的AI造假引文,自然难上加难。
针对这一困局,Topaz团队提出了4条改进建议。当下最紧迫的是第一条——期刊出版商需在同行评审启动前,将自动化引文核验纳入论文投稿流程。目前相关技术已经成熟,落地障碍并非技术问题,而是体制与成本问题。出版商需要投入资金、调整沿用已久的工作流程,这也是该建议看似可行,推进起来却阻力重重的原因。
而落地难度最大的,则是对已发表文献开展回溯清理。对数百万篇存量论文逐一筛查、发布更正内容,需要高昂成本,且没有任何一家机构愿意全权负责这项工作,同时学界也缺乏动力去复盘、修正已经刊发的论文。总结来说,当下最应该立刻推进的,是在投稿环节落实事前引文核验;而最难完成的,则是清理早已被污染的存量学术文献。
放眼未来3至5年,Topaz对整个行业最大的担忧是形成恶性循环。一篇含有虚假引文的论文发表后,会被后续新论文继续引用,甚至被用于训练新一代AI模型,进而让造假内容不断传播、放大。若不及时管控,文献库被污染的速度会远远超过清理修复的速度。
他向全球科研界、出版商和监管机构发出呼吁:立刻落实一项举措——将自动化引文核验定为同行评审前的标准流程。直白来讲,问题的根源是未经核查的AI生成内容流入永久学术文献。我们并非要禁止使用AI工具,而是要把核验环节嵌入整个工作流程。AI本身并非隐患,真正的风险是任由未经审核的AI产出内容堂而皇之地进入学术体系。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述