我的学习群里全是真大佬 第502章

再加上原生多模态和上百万token的上下文,就差没说老子就是全能了。

而OpenAI那边,它们这次的GPT-6主打的是写代码和智能体。

SWE-bench Verified上那五百道代码工单,它解决了其中的86.3%。

甚至还说FrontierMath他们也干到了48.7%。

FrontierMath是Epoch AI那群人专门搞出来折磨模型的研究级数学题,由易到难分作四级,最难的第四级一共五十道,道道都能让数学博士发蒙。

GPT的上一代旗舰最多也就干到了35%而已。

至于Anthropic家的Claude Opus 5,则在那张几乎被业内当成总成绩单的Artificial Analysis智能指数上,把综合分一举拉到了68,重新坐回了头把交椅,长程的智能体任务、编程,样样都令人咋舌。

他们交出这样的答卷,几家科技媒体自然是连夜赶出了长篇评测与盘点。

《AI的“iPhone时刻”又一次降临》,《通用人工智能或许真的不远了》。

里面都配上了那些一张张被刷新了记录的成绩图,看得让人热血沸腾的。

当然这些事最开心的就是华尔街了。

消息出来那天,整个美股科技板块跟着就大地震了。

纳斯达克综合指数单日跳涨 2.7%,盘中首次站上了 28000点,收报 28180点,再创历史新高。

英伟达股价一路飙升,市值盘中一度摸到 5.9万亿美元,眼看就要叩开 6万亿的大门了。

要知道就在几年前,华尔街还在预测那一家公司能够上万亿。

如今英伟达直接将这个数字翻了六倍。

而那些做数据中心的,也跟着吃上了这波红利。

从液冷供电到机柜,但凡沾上一点“算力基建”边的几乎是清一色地放量飙涨。

维谛技术单日就拉了 11%,几个做电源和散热的中小盘股,盘中涨幅一度冲到 20%以上。

当然一级市场比起它们也不遑多让。

某家明星实验室刚放出新一轮融资的风声,估值就被人一路推到了5000亿美元,投资人拿着钱排着队,生怕赶不上这趟车。

整个北美的人工智能像是在过圣诞节一样。

而华夏这边的气氛就要冷清太多了。

权威跑分一张张挂出来,那些榜单的前几名,清一色被那三家轮流坐了庄。

国内最能打的几家排着排着,就排到了让人不太愿意细看的位置了。

要放从前,某一家好歹还能时不时在某张推理榜上摸到个第三,惊艳众人一回。

可这一次,连那点位置都守不住了。

差距,肉眼可见地被拉开了。

这种差距,落在跑分榜上,不过是几个百分点的数字。

可落在那些用惯了国产模型、又眼睁睁看着别人一骑绝尘的普通人心里,滋味就远不止几个百分点那么轻巧了。

国内的网络上,很快就炸开了锅。

抖音和b站上,一个接一个的科普博主下场,掰开了揉碎了地讲,为什么我们这边的大模型,总要慢上人家一步。

算力、数据、人才、生态,一条条摆出来,讲得头头是道,播放量自然也跟着水涨船高。

有讲芯片被卡了脖子的,有讲顶尖人才不断外流的,也有翻出几年前的旧账,痛心疾首地复盘,我们究竟是从哪一步开始掉的队。

道理大同小异,结论也大同小异。

差距,不是一天拉开的,我们想追回来,自然也不是一天的事。

而这些科普视频下面的评论自然也是一片唱衰

“对呀对呀,我们国产那个某包,就只会把我当胎盘哄。”

“问它点正经的,张口就给你编。”

“认错倒是比谁都快,你一指出来,它立马您说得对,是我的疏忽,然后扭头就接着胡说。”

底下一串人附和,你一言我一语的,像是要把那点憋了许久的怨气全部发泄出来。

当然也有几个相对冷静的声音。

“其实国外那几个大模型,也一样会胡编乱造,这是大模型的通病跟国产进口真没多大关系。”

“不是,我用的克劳德,虽然死贵死贵的,可它是真的值。”

舆论就这么疯涨着,也不知道什么时候开始,抖音上开始出现了一批文案雷同的视频。

【作为普通人你一定要想办法用上Claude。】

【我的API中转站里面的Claude为什么这么便宜,因为我是做数据给投资人看的。】

特么的还是一套组合拳。

这些人说到底,就是为了制造焦虑而制造焦虑。

你今天不焦虑,他这视频可就没法变现了。

第421章 未央

与此同时,国内某家大厂的会议室里。

几个人围着长桌坐着,幕布上还显示着那几张有些刺眼的跑分榜图。

“不得不承认,这一回他们是真上了个台阶。”

一位高管叹气说道。

“不是从前那种小修小补,是模型的能力比起上一代有了质的飞跃。”

桌上一时间没人接话。

过了好一会儿,一个技术负责人才开口道。

“我听说……之前李东教授好像和他们沟通过很久,时不时林东教授给他们指的路?”

这话一出,好几个人都看向了他。

“消息准吗?”

“传得有鼻子有眼的。”

“反正这半年,他们进步这么快,你要说背后一点说法都没有我是不太信的。”

“要不……咱们也去请请李东教授?”另一个人试探着提议道,“咱也是华夏的本土企业,他总不能光顾着帮外人吧,再说了,真要谈钱,咱给他一个合适的价格就是了,咱们又不差钱。”

这提议一出口,在座的纷纷点头。

事不宜迟,散了会,几个人便各自动用起手里的关系,变着法子去联系那位李东教授了。

……

而被联系的最多的自然就是北行的李总。

这两天他这部手机就没消停过。

“喂?……哎哟,这事啊,我手上真没有李东教授的电话呀。”

“之前是联系过,可人家早换了号了”

“转达?我上哪儿替你转达去……”

接到第五六个的时候,李总直接就关机了。

他是真的服了。

这帮人,当他是傻子吗?

他要是真能联系上李东,他自己会不联系?

北行又不是没有大模型。

所以他是真的联系不上。

电话不是没人接,就是不再服务区……

他甚至还托了燕大的几个熟人去打听。

得到的回答都是,最近没见过李东的人。

没见过人?这种回答骗骗别人还行,他怎么可能信。

肯定是李东不愿意见他们而已。

想到这里李总只能独自叹了口气,又看起了国外的科技新闻。

……

就在“国外AI即将统治世界”的言论愈演愈烈的时候。

某天,FrontierMath第四级的榜单,悄悄地刷新了一下。

一个陌生的大模型出现在了榜单的首位,它的名字叫做——未央!

它背后跟着的数字是73.4%。

这是个什么概念呢?

那个吹牛逼最厉害的gpt-6也才跑了48.7%。

这已经不叫领先了,这叫断层。

前面那个一骑绝尘,后面一群人连它的影子都够不着。

最开始,没人把这个数字当真。

跑分榜上闹乌龙,又不是头一回的事。

多半是哪个新模型钻了题库的空子,要不就是评测脚本出了岔子,再不然,就是有人在背后刷榜……

技术论坛里清一色全是这类的猜测。

于是有好事者,拿着公开的那部分题目,自己动手复了一遍盘。

结果这个数据居然是真的!

紧接着,又有人在另外几张榜单上,看见了未央这个名字。

PutnamBench,那六百七十二道用Lean形式化写就的普特南竞赛题,排在最前面的,从来都是那几个烧钱烧到上千美元一道题的家伙。

而未央挂上去的成绩,是六百七十二道,全解。

一道不落,且每一道题后面,都有一份机器当场就能验过的完整证明。

然后在大家吃惊的时候……

miniF2F上的四百多道奥赛级的形式化题目,也被它清了个干干净净。

这两张榜,向来是机器证明这一脉的试金石。

它们的题目虽是公开的,证明却必须一步一步由机器亲自验过,才算数。

在这种地方,你糊弄不了任何人,蒙也蒙不过去。

所以消息很快就在AI圈和数学圈里,一同传开了。

谁也不知道这“未央”是打哪儿冒出来的,更想不通它凭什么能在这几张榜上,把所有人都甩出这么远。

不过这种公开的跑分的大模型到底是哪家的总是有办法查到的。

所以很快就有人把它给扒了出来……这模型出自燕大。

燕大?

要知道,上一个从华夏的大学里走出来还在国际上闯出过名号的大模型,还是智谱。

可如今这个未央看起来好像比智谱还要凶的样子。

不过很快就有眼尖的人注意到,未央并非张张榜单都拔尖。

在那张衡量综合智力的Artificial Analysis指数上,在比拼对话偏好的Chatbot Arena上,在考较编程的SWE-bench、考较多模态的那一类项目里,这个未央要么名次平平,要么干脆连个影子都找不着。