Richael
← 返回博客

2026-09-12

排行榜每周都在变,兴奋从来撑不过质疑

昨天 Anthropic、OpenAI 和 xAI 都发了各自的全力新模型,几个小时之内,基准和性能测试就到处都是,显示 Astra 6 强过 Fable 5.1,OpenAI 又回到了前面。人们于是庆祝这个「历史性」时刻,把它当成 Dario 傲慢的报应。很多人宣布自己要退订 Claude,转去别的平台。

这种场面好像之前出现过。几个月前也差不多,只是受害者换成了 OpenAI。目标一直在换,讨论却一模一样,而上一次宣布要换的人里,几乎没有谁在一个月后还在谈这件事。

真正让人难受的不是人们站哪一边,而是这股热情爆起和跌落的速度,以及它的代价。一个下午就来的兴奋,只能维持到一个前沿模型守住它的排名为止——平均一两周。你换过去,得到几周的新鲜感,下一次发布落地,你再换一次。你从来没有自己测过它们的能力。

而一个工具只有在无聊的那部分之后才开始回报你:在你摸清它在哪里会失败、它需要你的 prompt 给它什么、哪些活不能交给它之后。这比造势要花更长的时间,而造势衡量的只是一个窄的、平均过的能力版本,通常和你自己的工作没什么关系。

有用的问题从来不是哪个实验室在赢。你只有和它待得够久、真正用起来,才选得出来——从 Qwen 3.8-27b 到 Claude Opus 5。