再加上原生多模态和上百万token的上下文,就差没说老子就是全能了。
而OpenAI那边,它们这次的GPT-6主打的是写代码和智能体。
SWE-bench Verified上那五百道代码工单,它解决了其中的86.3%。
甚至还说FrontierMath他们也干到了48.7%。
FrontierMath是Epoch AI那群人专门搞出来折磨模型的研究级数学题,由易到难分作四级,最难的第四级一共五十道,道道都能让数学博士发蒙。
GPT的上一代旗舰最多也就干到了35%而已。
至于Anthropic家的Claude Opus 5,则在那张几乎被业内当成总成绩单的Artificial Analysis智能指数上,把综合分一举拉到了68,重新坐回了头把交椅,长程的智能体任务、编程,样样都令人咋舌。
他们交出这样的答卷,几家科技媒体自然是连夜赶出了长篇评测与盘点。
《AI的“iPhone时刻”又一次降临》,《通用人工智能或许真的不远了》。
里面都配上了那些一张张被刷新了记录的成绩图,看得让人热血沸腾的。
当然这些事最开心的就是华尔街了。
消息出来那天,整个美股科技板块跟着就大地震了。
纳斯达克综合指数单日跳涨 2.7%,盘中首次站上了 28000点,收报 28180点,再创历史新高。
英伟达股价一路飙升,市值盘中一度摸到 5.9万亿美元,眼看就要叩开 6万亿的大门了。
要知道就在几年前,华尔街还在预测那一家公司能够上万亿。
如今英伟达直接将这个数字翻了六倍。
而那些做数据中心的,也跟着吃上了这波红利。
从液冷供电到机柜,但凡沾上一点“算力基建”边的几乎是清一色地放量飙涨。
维谛技术单日就拉了 11%,几个做电源和散热的中小盘股,盘中涨幅一度冲到 20%以上。
当然一级市场比起它们也不遑多让。
某家明星实验室刚放出新一轮融资的风声,估值就被人一路推到了5000亿美元,投资人拿着钱排着队,生怕赶不上这趟车。
整个北美的人工智能像是在过圣诞节一样。
而华夏这边的气氛就要冷清太多了。
权威跑分一张张挂出来,那些榜单的前几名,清一色被那三家轮流坐了庄。
国内最能打的几家排着排着,就排到了让人不太愿意细看的位置了。
要放从前,某一家好歹还能时不时在某张推理榜上摸到个第三,惊艳众人一回。
可这一次,连那点位置都守不住了。
差距,肉眼可见地被拉开了。
这种差距,落在跑分榜上,不过是几个百分点的数字。
可落在那些用惯了国产模型、又眼睁睁看着别人一骑绝尘的普通人心里,滋味就远不止几个百分点那么轻巧了。
国内的网络上,很快就炸开了锅。
抖音和b站上,一个接一个的科普博主下场,掰开了揉碎了地讲,为什么我们这边的大模型,总要慢上人家一步。
算力、数据、人才、生态,一条条摆出来,讲得头头是道,播放量自然也跟着水涨船高。
有讲芯片被卡了脖子的,有讲顶尖人才不断外流的,也有翻出几年前的旧账,痛心疾首地复盘,我们究竟是从哪一步开始掉的队。
道理大同小异,结论也大同小异。
差距,不是一天拉开的,我们想追回来,自然也不是一天的事。
而这些科普视频下面的评论自然也是一片唱衰
“对呀对呀,我们国产那个某包,就只会把我当胎盘哄。”
“问它点正经的,张口就给你编。”
“认错倒是比谁都快,你一指出来,它立马您说得对,是我的疏忽,然后扭头就接着胡说。”
底下一串人附和,你一言我一语的,像是要把那点憋了许久的怨气全部发泄出来。
当然也有几个相对冷静的声音。
“其实国外那几个大模型,也一样会胡编乱造,这是大模型的通病跟国产进口真没多大关系。”
“不是,我用的克劳德,虽然死贵死贵的,可它是真的值。”
舆论就这么疯涨着,也不知道什么时候开始,抖音上开始出现了一批文案雷同的视频。
【作为普通人你一定要想办法用上Claude。】
【我的API中转站里面的Claude为什么这么便宜,因为我是做数据给投资人看的。】
特么的还是一套组合拳。
这些人说到底,就是为了制造焦虑而制造焦虑。
你今天不焦虑,他这视频可就没法变现了。
第421章 未央
与此同时,国内某家大厂的会议室里。
几个人围着长桌坐着,幕布上还显示着那几张有些刺眼的跑分榜图。
“不得不承认,这一回他们是真上了个台阶。”
一位高管叹气说道。
“不是从前那种小修小补,是模型的能力比起上一代有了质的飞跃。”
桌上一时间没人接话。
过了好一会儿,一个技术负责人才开口道。
“我听说……之前李东教授好像和他们沟通过很久,时不时林东教授给他们指的路?”
这话一出,好几个人都看向了他。
“消息准吗?”
“传得有鼻子有眼的。”
“反正这半年,他们进步这么快,你要说背后一点说法都没有我是不太信的。”
“要不……咱们也去请请李东教授?”另一个人试探着提议道,“咱也是华夏的本土企业,他总不能光顾着帮外人吧,再说了,真要谈钱,咱给他一个合适的价格就是了,咱们又不差钱。”
这提议一出口,在座的纷纷点头。
事不宜迟,散了会,几个人便各自动用起手里的关系,变着法子去联系那位李东教授了。
……
而被联系的最多的自然就是北行的李总。
这两天他这部手机就没消停过。
“喂?……哎哟,这事啊,我手上真没有李东教授的电话呀。”
“之前是联系过,可人家早换了号了”
“转达?我上哪儿替你转达去……”
接到第五六个的时候,李总直接就关机了。
他是真的服了。
这帮人,当他是傻子吗?
他要是真能联系上李东,他自己会不联系?
北行又不是没有大模型。
所以他是真的联系不上。
电话不是没人接,就是不再服务区……
他甚至还托了燕大的几个熟人去打听。
得到的回答都是,最近没见过李东的人。
没见过人?这种回答骗骗别人还行,他怎么可能信。
肯定是李东不愿意见他们而已。
想到这里李总只能独自叹了口气,又看起了国外的科技新闻。
……
就在“国外AI即将统治世界”的言论愈演愈烈的时候。
某天,FrontierMath第四级的榜单,悄悄地刷新了一下。
一个陌生的大模型出现在了榜单的首位,它的名字叫做——未央!
它背后跟着的数字是73.4%。
这是个什么概念呢?
那个吹牛逼最厉害的gpt-6也才跑了48.7%。
这已经不叫领先了,这叫断层。
前面那个一骑绝尘,后面一群人连它的影子都够不着。
最开始,没人把这个数字当真。
跑分榜上闹乌龙,又不是头一回的事。
多半是哪个新模型钻了题库的空子,要不就是评测脚本出了岔子,再不然,就是有人在背后刷榜……
技术论坛里清一色全是这类的猜测。
于是有好事者,拿着公开的那部分题目,自己动手复了一遍盘。
结果这个数据居然是真的!
紧接着,又有人在另外几张榜单上,看见了未央这个名字。
PutnamBench,那六百七十二道用Lean形式化写就的普特南竞赛题,排在最前面的,从来都是那几个烧钱烧到上千美元一道题的家伙。
而未央挂上去的成绩,是六百七十二道,全解。
一道不落,且每一道题后面,都有一份机器当场就能验过的完整证明。
然后在大家吃惊的时候……
miniF2F上的四百多道奥赛级的形式化题目,也被它清了个干干净净。
这两张榜,向来是机器证明这一脉的试金石。
它们的题目虽是公开的,证明却必须一步一步由机器亲自验过,才算数。
在这种地方,你糊弄不了任何人,蒙也蒙不过去。
所以消息很快就在AI圈和数学圈里,一同传开了。
谁也不知道这“未央”是打哪儿冒出来的,更想不通它凭什么能在这几张榜上,把所有人都甩出这么远。
不过这种公开的跑分的大模型到底是哪家的总是有办法查到的。
所以很快就有人把它给扒了出来……这模型出自燕大。
燕大?
要知道,上一个从华夏的大学里走出来还在国际上闯出过名号的大模型,还是智谱。
可如今这个未央看起来好像比智谱还要凶的样子。
不过很快就有眼尖的人注意到,未央并非张张榜单都拔尖。
在那张衡量综合智力的Artificial Analysis指数上,在比拼对话偏好的Chatbot Arena上,在考较编程的SWE-bench、考较多模态的那一类项目里,这个未央要么名次平平,要么干脆连个影子都找不着。
上一篇:我家艺人太没上进心了
下一篇:挨打永久加防御,神魔都打不动我