内容提要
谷歌学术上出现约189篇含“肾失望”的论文,实为“肾衰竭”被机器改写所致,源于论文工厂用同义词替换工具洗稿规避查重,形成系统性学术造假。自2005年SCIgen起,此类问题已泛滥超11000篇,污染顶级期刊,甚至影响AI训练。错误一旦固化难以清除,撤稿速度远不及造假速度,凸显学术诚信危机。
延伸解读
“肾失望”背后的学术造假产业链
“肾失望”并非偶然笔误,而是论文工厂利用同义词替换工具洗稿的产物。这类工具将“肾衰竭”替换为“肾失望”,以规避查重检测。论文工厂批量生产此类论文,通过版面费牟利,形成一条完整的学术造假产业链。买家多为需要评职称或申请项目的研究人员,他们付费购买“原创”论文,而部分期刊因收取版面费而疏于审核,导致问题论文得以发表。
问题论文的污染范围远超想象
“肾失望”只是冰山一角。自2005年SCIgen出现以来,问题论文数量已超过11000篇,且不仅出现在野鸡期刊,Elsevier、Springer Nature等顶级出版商也未能幸免。2022年,物理学会撤稿近500篇,Springer Nature对400多篇论文发出关注。这些论文互相引用,形成虚假学术网络,污染学术数据库,甚至可能误导AI训练,影响深远。
撤稿速度远不及造假速度
尽管Cabanac团队开发了Problematic Paper Screener等工具来识别问题论文,但撤稿速度远不及造假速度。Google Scholar上“kidney disappointment”的搜索结果从2021年至今一条未减,部分论文已被引用42次。错误一旦进入数字生态系统,可能被AI放大固化,成为难以清除的“数字化石”,凸显学术诚信危机的严峻性。
Q&A
谷歌学术上为什么会出现“肾失望”这样的怪词?
这些怪词是论文工厂使用同义词替换工具(如 paraphrasing 软件)对原文进行“洗稿”以规避查重检测时产生的,例如将“肾衰竭”(kidney failure)替换为“肾失望”(kidney disappointment)。
什么是“文章 spinning”?它如何被用于学术造假?
“文章 spinning”是指利用工具自动替换同义词、调整句式,将现成文字改写成看似新的内容,目的是绕过查重软件。造假者通常抄袭摘要后使用该技术,导致论文中出现大量非标准术语(tortured phrases),如“肾失望”。
“tortured phrases”有哪些典型例子?
典型例子包括:将“乳腺癌”写成“bosom peril”,将“人工智能”写成“counterfeit consciousness”,将“模糊逻辑”写成“fluffy rationale”,将“智能设备”写成“shrewd devices”,将“原始数据”写成“uncooked records”,将“磁共振”写成“attractive reverberations”,以及将“信噪比”写成“flag-to-commotion ratio”等。
SCIgen 是什么?它和“肾失望”现象有什么关系?
SCIgen 是 2005 年 MIT 学生开发的程序,能自动生成胡言乱语的计算机科学论文,曾导致 Springer 和 IEEE 撤回 122 篇论文。它使用无上下文语法随机组合词汇,而“肾失望”的制造工具更高级,会拿真实论文进行洗稿,但本质上都是用机器生产“看起来像论文”的内容。
论文工厂是如何运作的?
论文工厂批量生产论文,使用 paraphrasing 工具拼凑内容,用 tortured phrases 规避查重,并通过互相引用抬高引用量。买家是需要评职称或拿项目的研究人员,他们付费购买论文,工厂在几天内生产出“原创”论文并发表在审核不严的期刊上。
“肾失望”现象为什么比单纯的用词不当更严重?
因为“肾失望”是系统性造假的指纹,表明论文可能经过洗稿,核心内容可能抄袭;这些论文互相引用形成虚假学术网络,污染学术数据库,误导后续研究和 AI 训练;而且涉及“肾衰竭”这种致命疾病,错误术语可能误导患者,构成伦理问题。
AI 的出现让学术造假问题变得更糟了吗?
AI 生成的论文更流畅、更难被发现,但也会暴露身份或捏造引用。造假者甚至用 AI 润色 AI 内容并插入拼写错误以骗过检测。更严重的是,错误一旦进入数字生态系统,可能被 AI 放大和固化,如“vegetative electron microscopy”一词已出现在 22 篇论文中,几乎无法清除。
“Problematic Paper Screener”是什么?它有什么局限性?
“Problematic Paper Screener”是 Cabanac 团队开发的工具,用于扫描包含 tortured phrases 的论文。但它只能发现问题,无法解决问题,因为撤稿需要期刊主动行动,而很多期刊可能因收取版面费而不愿撤稿。