关闭广告

谷歌IMO金牌级Gemini 3深夜上线!华人大神挂帅,OpenAI无力反击

新智元2227人阅读


新智元报道

编辑:桃子 好困

【新智元导读】Gemini 3 Deep Think用2.5倍的暴力性能把GPT-5.1踩在脚下,OpenAI若再不发新模型,这「推理之王」的宝座今天就正式换人了!

太劲爆了!

不过半月,谷歌DeepMind终于放出了IMO最强金牌模型——Gemini 3 Deep Think。


今年夏天,Gemini 2.5 Deep Think分别在IMO、ICPC国际大赛中,拿下了金牌的战绩。

这一次,谷歌为其注入了全新的血液——Gemini 3。

凭借着「并行思考」能力,Gemini 3 Deep Think可以搞定超高难度的数学、科学难题!

在基准测试中,Deep Think全面碾压Gemini 3 Pro,尤其是在HLE上,未用工具拿下了41%高分。

同时在ARC-AGI-2上,以45.1%成绩领跑全球。


下面实例中,同一个指令,让Gemini 3 Pro和Deep Think版基于一张博物馆展馆屋顶的草图,创建一个精确的交互式3D场景。

显然,后者在还原度上,与原图几乎是1:1复刻,并在交互上,光影变化符合物理逻辑。


今天,Gemini 3 Deep Think已在Gemini App上线,所有Ultra用户即可体验。


最强IMO金牌模型来了

Gemini 3 Deep Think正式开启了「深度思考」新纪元,让智能的边界再次拓展。

Gemini 3 Deep Think基于上一代Gemini 2.5 Deep Think迭代而来,在推理能力上实现了质的飞跃。

它专门用于攻克那些连当今最顶尖模型,都感到棘手的复杂数学、科学和逻辑难题。


在多项基准测试中,Gemini 3 Deep Think都拿下了行业领先成绩。

在Humanity’s Last Exam(无工具辅助)上刷爆41%,并在ARC-AGI-2(配合代码执行),创下45.1%新纪录。


在ARC-AGI-1和ARC-AGI-2上,Gemini 3 Deep Think实力堪称无「模」能敌。



左右滑动查看

之所以这么强,是因为Deep Think采用了「并行推理」来同时思考,能够同时探索多种假设。

在谷歌DeepMind放出的更多demo中,可以看出Gemini 3 Deep Think强大之处。

如下,让它打造一款3D版多米诺骨牌游戏。在关卡设置中,Deep Think兼具创意与惊喜,而且还模拟出了真实的碰撞物理效果。


这个例子,是要求Gemini 3 Pro和Deep Think分别在单个HTML文件中创建程序化生成的地球类行星。

左右对比一眼即可看出,Deep Think更加有创造力。


另有开发者实测惊叹道,Gemini 3 Deep Think具备惊人的能力。


上传一张玻璃瓶的照片,让它生成一个软橡胶同款掉在地上的3D动画。


有网友激动地表示,按照这个速度,我们将在2026年真正实现AGI!


华人科学家领衔,AGI王牌队冲刺

同在今天,谷歌DeepMind官宣,将在新加坡组建一支全新的精英团队。

它将由华人科学家Yi Tay率队,专攻高级推理、LLM/RL,以及推进Gemini、Gemini Deep Think等最前沿SOTA模型的发展。

Yi Tay将向位于山景城由Quoc Le(谷歌Fellow级大佬)领导的团队汇报。

恰好,这一团队正是Gemini Deep Think在国际竞赛中夺下金牌的核心力量之一,同时也在Gemini上取得重要进展。


Yi Tay表示,我们会从一支人不多但超强的小团队开始。

因为在大模型的时代,「人才密度」比什么都关键。

关键是,这个团队还能与AI领域传奇大神联动研究,其中就包括「推理之王」Denny Zhou、「香蕉」背后的男人Mostafa Dehghani、AI界的「GOAT」Noam Shazeer。

同时,还有很多「神仙队友」一起加入研究,包括生成式检索的发明人Vinh Q. Tran、IMO金牌项目总负责人Thang Luong、思维链开创者Xuezhi、日本顶尖AI大神Shane Gu等人。

过去几个月,谷歌DeepMind便开始秘密招募全球顶尖人才。

这一项目得到了Demis Hassabis、Jeff Dean等内部高层的大力支持。



如今,他们继续发出英雄招募帖,有机会站上通往AGI的关键赛道。

用不了多久,这支新加坡团队很快就会成为一支战斗力爆表的队伍。


Gemini 3爆冲15%流量

随着Gemini 3 Pro的强势发布,其网页端的市占率再创新高,突破15%大关。

与此同时,Grok也凭借着4.1版本的发布持续增长。

ChatGPT在流量上依然断崖式领先,但份额却在持续下降。



Gemini延续增长势头,访问量达到13.51亿次,较10月增长14.3%。ChatGPT跌破60亿次大关,网站访问量降至58.44亿次。

这是继7月之后,ChatGPT 在 2025 年出现的第二次环比下滑。


尽管在11月18日(Cloudflare宕机当天),ChatGPT创下了单日2.33亿次访问的历史纪录,但这并未扭转整体流量的跌势。

此外,Grok网站访问量达到2.344亿次,创下历史新高,较10月增长14.7%。

这也是该网站自启用当前域名以来,首次实现连续两个月的流量增长。




左右滑动查看

参考资料:

https://x.com/GoogleDeepMind/status/1996658401233842624?s=20

https://x.com/YiTayML/status/1996640869584445882?s=20

https://x.com/Similarweb/status/1995792272785310186

秒追ASI

⭐点赞、转发、在看一键三连⭐

点亮星标,锁定新智元极速推送!

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

萧煌奇妻子正面照曝光:是短发气质美女,双方否认是奉子成婚

素素娱乐 浏览 1931

首拍飙至数千万元的“京东第一车”,最低4.54万元就能买到?

都市快报橙柿互动 浏览 2542

离婚2个月,54岁的李亚鹏再迎“噩耗”

洲洲影视娱评 浏览 2121

E句话| 梁小龙去世,成龙周星驰发文悼念

仙女事件簿 浏览 2015

被曲解的雷军:“安全至上”与“好看第一”并不冲突

虎嗅APP 浏览 2354

周末两大利空!科技股被一致看空,国常会、证监会重磅

看财经show 浏览 2571

smart精灵6内饰官图:为何总说“吉利味儿”很重?

车动态 浏览 1063

与美主持人激烈辨论后被闭麦 万斯怒了

环球网资讯 浏览 12117

邮报:纽卡中卫丹-伯恩遭遇肺穿孔和肋骨骨折,将缺阵六周

懂球帝 浏览 2327

无需多视角,单图重建可交互3D模型!南洋理工开源结构推理框架

新智元 浏览 913

白宫:万斯巴基斯坦之行已被取消

新华社 浏览 913

胖东来发布针对博主"惊梦人"新声明:驳斥利益输送言论

大象新闻 浏览 2239

真爱大牌返场|| 一上线就被抢空的牌子,这次居然100+就能拥有

黎贝卡的异想世界 浏览 2599

卡塞米罗:我离开皇马时安帅哭了;吉马良斯是巴西下一代领袖

懂球帝 浏览 718

中式坐月子,震撼欧美中产

她刊 浏览 14

港姐亚军自曝遭网暴!骚扰者竟是小区保安

TVB剧评社 浏览 2578

知名男演员景区打工两个月成"顶流NPC" 本人回应

极目新闻 浏览 10629

美方在北约外长会上"炮轰"欧盟 被指系又一次强硬姿态

澎湃新闻 浏览 8707

关系藏不住了?小S二女儿被曝恋情

小梊搞笑解说 浏览 2788

BBA大促混战,谁是真性价比之王?

百姓评车 浏览 2006

致敬最美科技工作者丨程显:砺剑破壁垒 锻造“强国芯”

大象新闻 浏览 273
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
Copyright © 2020-2022,版权所有 qukanredian.com
沪ICP备20002587号-1