详细内容或原文请订阅后点击阅览
在论文洪流中生存:ICRA 小组关于出版、法学硕士和同行评审的未来的笔记
ICRA 最近举行的题为“在论文洪流中幸存”的小组聚集了领先的机器人研究人员,他们一直在努力应对当今发表的大量机器人论文。讨论范围从出版物增长的硬数据、大型语言模型 (LLM) 的承诺和风险,到重塑同行评审的激进建议,因为我们 [...]
来源:RobohubICRA 最近举行的题为“在论文洪流中幸存”的小组聚集了领先的机器人研究人员,他们一直在努力应对当今发表的大量机器人论文。
讨论范围从出版物增长的硬性数据、大型语言模型 (LLM) 的前景和风险,到重塑我们所知的同行评审的激进提案。
小组主席 Aude Billard 指出,IEEE 机器人与自动化协会的主要会场迅速增长,从 2017 年左右开始呈大致指数曲线。预计 2025 年将有大约 70,000 篇论文包含“机器人”一词。
Billard 指出,虽然在某些领域,极端专业化可能是一种可以接受的生存策略,但机器人技术本质上是不同的。机器人是感知、控制、操纵、学习、硬件、交互、安全和部署的集成。如果研究人员只能在狭窄的孤岛内保持最新状态,那么该领域就有可能失去其核心优势之一:跨领域连接想法的能力。
姚鲲鹏介绍了由 IEEE RAS 科学技术观察委员会资助的案例研究。在当今的出版环境中,该团队试图做一些近乎英雄的事情。也就是说,在一年内仔细阅读整个子领域。
围绕演示学习相关论文,团队在 IEEE Xplore 中搜索 2024 年相关论文,并手动筛选结果,识别出 347 篇相关论文。其中,只有 69 人(约 20%)被认为做出了显着贡献。
根据所使用的标准,“著名”论文往往会提供新的表述、机制或理论保证;与最先进的技术进行认真的比较;在稳健性、传输或故障恢复方面有明显的进步;新的教学或数据收集方式;以及令人信服的真实机器人验证。当论文只是简单地重新标记现有方法或未能证明其主张时,它们就不那么引人注目了。
姚明简洁地总结了一个教训:知名度应该根据最先进的技术来判断,而不是根据“最新的词汇”。
这种区别在新标签可以快速传播并且论文可能听起来很新鲜但实际上并未移动前沿的领域中尤为重要。相反,有用的作品有时隐藏在不太时尚的场所或由不太引人注目的群体撰写。
幻觉程度
一个问题是大型语言模型是否有助于文献综述。Nadia Figueroa 解释说,法学硕士可以改善文献综述的机制。也就是说,它们可以帮助进行搜索、检索、聚类、表格、摘要和粗略概念图。曾经需要数周或数月的工作现在有时可以在数小时内完成。对于进入某个领域的新博士生来说,这确实降低了进入门槛。
但菲格罗亚也认为幻觉是一个主要问题。一阶幻觉涉及虚假或不正确的参考。更微妙的是二阶幻觉,其中参考是真实的,但模型错误地陈述了论文实际做了什么。同样危险的是三阶幻觉,法学硕士在论文中发明了看似合理但虚假的共性。
“目前的危险不是虚假引用,”菲格罗亚观察到。 “这是虚假的理解。”
基于法学硕士的文献综述可能包含真实的论文,但仍然歪曲了该领域。它可能是流畅的、结构化的,也可能是错误的。如果研究人员不仅外包阅读机制,还外包比较、判断和怀疑的认知行为,那么该领域可能会产生更多文本,但理解能力却会减少。
萨拉米香肠和沙堡
与此同时,格雷格·杜德克 (Greg Dudek) 描述了人们所熟悉的“萨拉米切片”问题,即较大的工作量被分成“尽可能薄的切片”,并分布在研讨会、会议和期刊中。
对于 Dudek,系统会奖励这种行为。学生需要论文才能毕业。早期职业研究人员需要论文才能找到工作。委员会经常面临太多的材料而无法深入阅读,因此标题、地点、计数和索引成为诱人的捷径。
但结果对于读者来说代价高昂。多篇论文重复相同的背景,将一篇文章分成碎片,使重建整个故事变得更加困难。
他首选的补救措施原则上很简单,但实践起来却很困难:发表更少、更综合的论文。
杜德克对这有多困难并不抱任何幻想。 “没有解决办法,”他说,如果我们所说的解决办法意味着回到一个更安静的世界。渐进式改革可能会有所帮助,但洪水仍在上涨。他将一些小的程序修复与在沙堡周围建造更好的墙壁进行了比较,同时“海啸从房间的后面传来”。
重新设计同行评审?
Renaud Detry 认为出版物的增长部分反映了学术场所中应用系统工作的不断增长。这并不一定是坏事。机器人技术通过真实的系统、数据、基准、平台以及使想法在理想化环境之外发挥作用所需的最后一英里的努力而取得进步。
问题在于,相同的评估机制通常会判断非常不同的贡献类型。新算法、精心设计的系统、基准、数据集和工业相关的验证研究不应该都假装是同一类型的论文。机器人技术可能需要更清晰的基础科学、应用、基础设施、基准和技术正确性。
可见性不是价值
Dongheui Lee 谈到了新出版生态系统的另一个重要部分:arXiv、开源版本、项目页面、视频、博客和社交媒体。这些工具可以扩大访问范围,提高可重复性,并帮助读者决定仔细检查什么。但它们也会扭曲注意力。可见度可以反映机构的声望、网络、速度和自我推销以及科学价值。
Lee 的建议很务实:将专家同行评审作为质量过滤器,但更好地利用其信号。编辑委员会和媒体团队可以采取更多措施来推广那些获得好评但并非来自著名实验室的强论文。
超越看门人模型
最激进的问题来自 Shigeki Sugano,他问道:“如果我们完全放弃同行评审怎么办?”在菅野的模型中,合法的机器人和人工智能手稿将首先与视频、代码和数据一起上传到开放档案馆。
社区评估将在经过身份验证的情况下公开进行。然后,期刊和会议将认证高价值的工作,而不是决定什么存在。
“问题不在于同行评审是否有价值,”他认为。 “问题是它是否必须仍然是通向可见性的唯一大门。”
并非所有人都同意。其他小组成员强调,受欢迎程度偏差、博弈、声誉效应和充斥系统的低质量论文是可能存在的风险。尽管如此,菅野的激进提议解决了传统接受或拒绝同行评审模型扩展能力以应对充斥机器人社区信息空间的大量论文的能力所面临的真正挑战。
悬而未决的问题
本文最初发表于 IEEE RAS。
小组中没有人假装已经找到了一个干净的解决方案。相反,论文洪流是数量、激励、工具、评估、可见性和文化的混乱。
尽管如此,还是出现了一些有用的原则。法学硕士可能会提供一些机械支持,但会带来智力外包的风险。有选择地、深入地阅读。在发表之前奖励质量。认识到机器人研究的不同价值。将知名度视为可能的价值指标,而不是判断。
一个主要问题仍然存在:如果论文继续以目前的速度发表,机器人研究会发生什么?
有明显的好处。更多的论文、更多的预印本和更多的出版途径可以降低进入壁垒,帮助新研究人员找到立足点,并使该领域更加开放,接受更广泛的声音。 arXiv 等平台还使得作品在传统出版渠道之前或之外更容易流通。
但风险同样明显。机器人技术是一个综合领域,汇集了感知、控制、操纵、运动、硬件、安全、学习和人机交互。如果研究人员只能跟上该领域的一小部分,那么该领域可能会变得更加孤立。结果可能是越来越依赖现成的工具,包括黑盒商业系统,而没有深入了解这些工具所依赖的基础。
还有内存的问题。在一定规模上,没有哪个研究人员能够足够深入地回顾或足够广泛地跨越相邻领域。这增加了重复工作、被忽视的见解以及重要论文在下一波更流行的话题下消失的风险。
IEEE 机器人与自动化协会 (RAS)致力于推进机器人和自动化领域的创新、教育以及基础和应用研究
