海面、远处的灯塔与礁石旁的人

投稿越来越多,然后呢?

ICLR 2027 摘要阶段的取号已经过了六万,AAAI 2027 也传出五万多份初始投稿。数字还在往上走,关于论文和审稿的抱怨也越来越多。看着这些,我常有一种感觉:很多以前默认成立的东西,正在一点点松动。

同一个人,换个身份就换了立场

社交媒体上有一个熟悉的循环。审稿时,大家抱怨收到的都是些什么文章,怎么又是 autoresearch;出分后,变成作者抱怨 reviewer 太 mean,连文章都没看懂。同一个人换个身份,就站到了另一边。

再往后,讨论开始围绕一些奇怪的特征展开:图太好看、文字太流畅、写得太 defensive,像 AI;图不好看、表达混乱,又是流水线生成。正反两种特征都能支持同一个结论,这套判断方法就再也没法纠错了。大家都在努力辨认一篇文章是怎么生产出来的,却越来越少问它到底做成了什么。

另一边是对论文本身的否定:A 会全是 trash,论文成了厕纸,发了也找不到工作。这种话很容易引起共鸣。但论文有没有知识价值、能不能证明作者的能力、能不能换来一个机会,本来就是三个问题。过去它们被捆在一起期待,现在裂缝变大了。所以一边说论文没用、一边赶下一个 deadline,并不矛盾。

一个越转越快的循环

我觉得真正值得讨论的不是 AI 能不能写论文,而是论文的生产、评审和职业回报之间,正在形成一个什么样的循环。

工具降低了代码、实验和写作的成本,却没有降低大家对论文数量的需求。毕业、申请、招聘、考核都还要这些结果。省下来的时间,未必变成更充分的验证,更可能变成下一篇投稿。

对作者来说,多投一篇就多一次机会;对整个系统来说,多一篇就要多几个人去读、去查、去讨论。收益归个人,成本摊给整个社区。

更麻烦的是信任崩掉之后。如果作者觉得评审很随机,就更有理由多投、重投,用次数对冲运气。投稿越多,评审越难做扎实。一份敷衍的 review 既说服不了作者,也减少不了下一轮投稿,只会让人更相信"换一组 reviewer 就好了"。

大家对评价越没信心,就越想多试几次;试的次数越多,评价就越难做好。

这个循环不需要所有人都在灌水,认真做研究的人也会在这种环境里选择多投几次。所以把问题归结为作者不认真,或者 reviewer 太 junior,都解释不了全部。制度本身在奖励那些让系统更拥堵的选择。

凭证的尴尬

那么,一篇顶会论文还意味着什么?

它仍然能让工作进入公共讨论,接受一定程度的检查,也能在申请和招聘里降低别人了解你的成本。但我们习惯顺手附加的那串推论从来都不是自动成立的:文章被接收,所以工作重要;工作重要,所以作者很强;作者很强,所以值得给更多资源。AI 参与得越多,这串推论就越需要额外的信息来支撑。

于是出现了一种很别扭的状态:大家都觉得这个指标越来越不够用,又必须继续拿到它。零篇论文时说论文没意义,容易被当成失败后的说辞;有了论文再说,又已经按这套规则玩过一遍了。

你得先拿到凭证,别人才相信你对凭证的批评来自判断,而不是失落。

一个评价哪怕被广泛怀疑,只要它还在分配机会,就不会轻易退场。

就算六万篇都是好文章

但比"坏论文太多"更难的问题在后面。

假设六万篇投稿的作者都认真做了实验,都讲得清为什么做,都愿意对结果负责,也都带来了一点真实的新发现。如果质量问题真的被解决了,焦虑会消失吗?

我觉得不会。

正确、有贡献、值得优先关注,是三个不同的门槛。职位、资金和合作机会仍然有限。对知识生产来说,这也许是成功;对靠研究谋生的人来说,却意味着更激烈的竞争。做好一项工作,和靠它获得足够的回报,正在变得越来越不一致。

"至少我认真负责"回答不了这个问题。它能排除一些不该做的事,却说明不了你比其他同样认真负责的人更值得被选中。

Hands-on、taste 和问心无愧

所以 hands-on、taste、问心无愧这些词很重要,但不能一直拿来结束讨论。

Hands-on 的价值在于接触细节、发现错误、理解结果,而不在于人工操作的数量。如果人加上工具做出来的东西,仍然不如一个自动系统可靠,就不能凭投入了更多心血去要求更高的评价。苦劳改变不了结论的真假。

但是,我还是坚持亲手做。不是因为苦劳该被奖励,它不该。而是我亲手调过 baseline、看过不稳定的 seed、碰到过不符合叙事的样本,才知道自己的结果哪里是硬的、哪里是脆的。这种"知道",是我以后判断任何工作的底气,包括模型做的工作。

学习和成果也要分开看。一个新人亲自复现实验、检查数据、推导证明,即使没有发表价值,也是在训练自己以后判断工作的能力。不能从"AI 做得更快"直接推出"人不值得学"。值得学习、值得发表、值得继续投入,是三个问题。 分清楚了,才不会一边拿练习去要求学术回报,一边又因为工具更快,把自己的学习全部取消。

Taste 也一样。在评论区指出一个工作的弱点,和在结果出来之前决定做什么、放弃什么,不是同一种难度。如果模型也能参与甚至改善这些判断,那就用它。我不想为人类找一块永远不被模型进入的领地。今天说它不会选题,明天说它没有经历,后天说它不能长期坚持,每次往后挪一步,只会越来越不安。更值得检查的,是我和工具一起做出的决定,最后带来了什么。

早一点找人聊

真正难的,往往是投入之后的判断。

做了几个月,人很难接受自己的工作可能没那么重要,"我只是没被看懂"就变得格外有吸引力。它有时完全属实,但它也能解释几乎任何一次失败。敷衍的人、认真但判断失误的人、真正被误解的人,都能讲出"好工作被埋没"的故事,而作者自己的确信区分不了这三者。

找人聊是我做过最有用的事,只是我以前常常问错问题。我总在问"怎么写得更好",其实更该问"这个结论站得住吗""这个问题还值得做吗"。越早问,越听得进去,也越舍得改。

Presentation 仍然是作者的基本义务。读者没有义务替你整理混乱的论证,审稿人也不该用猜文风来代替检查内容。写得清楚能帮助判断,写得漂亮补不上证据。两边的责任并不冲突。

至于 reviewer 和 author 互相指责的循环,最后还是要回到具体的争议上:哪里错了,缺什么证据,什么结果能让双方改变看法。网上说得最响的人,不一定最有判断力。

都有 Opus,为什么突出的还是那些人

因为共用模型,不等于共用研究条件。

数据、算力、真实场景、合作者、试错的时间,决定了一个想法能不能被验证。模型给出一个建议很容易,让这个建议在真实环境里跑几个月,需要的是另一整套条件。一个知道问题在哪、能安排验证、能调动资源的团队,可以很快把模型的产出变成结果;缺少这些条件的人,得到的可能主要是更多候选想法和更漂亮的材料。

资源决定哪些事做得到,判断决定资源花在哪里,声誉又带来下一次资源,这几样互相加强。争取资源、组织合作、让事情持续推进,本身也是能力。一句"强者恒强"会把这些差别都藏起来。

用脚投票,也有门槛

当单篇论文不足以说明一个人的能力,评价自然会更多地看具体工作和长期记录:代码有没有人用,结果有没有被复现,做过什么产品,合作过的人愿不愿意再合作,写的东西有没有帮别人理解问题。Blog、教程、工具、数据和基础设施,也应该得到与贡献相称的承认。

我觉得这些信号比"发了几篇"更诚实,应该被更多地看见。但它们对新人不友好:要有人用,先得有人看见;要有口碑,先得有合作的机会。所以公开发表这个入口不该被丢掉,不过这也不是退回去只看论文的理由。

换指标也不会结束对指标的迎合。当大家开始比 stars、粉丝和影响力,新的包装方式也会出现。宣传本身没有问题,把工作送到需要它的人面前,本来就能扩大贡献。值得问自己的是:我是在让更多人用上它,还是主要在证明它有影响力。

投稿,和之后的选择

这些也改变了我看投稿的方式。投稿是展示结果、寻求反馈、进入讨论、争取机会的一种方式,值得认真准备,但一项工作的价值不该只剩一次 accept 或 reject。没中,就去分辨哪些意见指出了真实缺陷、哪些是误解、这项工作还值不值得继续做;中了,录用也不会替你完成后续的验证。

职业选择上也可以坦然一些。有人想深挖一个问题,有人想做成产品,有人更在意收入和好的团队。我愿意要钱、要落地、要声誉,不觉得这让研究变脏了。我只是不打算让它们替我决定所有事。

最后

开头说,很多以前默认成立的东西正在松动。有时候真的觉得什么都在崩,AI 正一样一样地碾过去。我不知道最后会变成什么样,也不指望很快会有一套让人安心的新规则。

能做的,大概还是几件朴素的事:把工作做扎实,早一点找人聊,诚实地对待 credit,被质疑时拿证据说话。继续学,对新的东西保持开放,允许今天的判断明天被推翻。评价体系的问题需要制度来解决,不能全靠个人自律消化,但属于自己的那一份,我想守住。

还有,我不想变成除了 research 什么都没有的人。我喜欢窗台上那几盆绿植,喜欢在常去的咖啡厅坐一下午,喜欢在特摄小店里翻上一个小时、最后什么也没买,也喜欢和喜欢的人待在一起。它们不会让我的论文更容易中,也不需要。

后来我想,本来就没有什么是一成不变的。会议会变,评价会变,工具会变,我今天相信的东西也会变。既然这样,我不必等一切都停下来,才开始好好生活。

世界在晃的时候,这些东西让我知道自己站在哪里。

END / 2026.10.05回到顶部 ↑