-
2026 年 02 月 13 日當 AI 的競爭從「誰生成得更流暢」進入「誰推理得更深入」,真正的差距才開始被放大。Google 今天宣布推出最強大的 Gemini 3 Deep Think,它是一個專門為高階邏輯推導與科研任務打造的推理模式。在多項高難度 Benchmark 測試中,它與 Claude Opus 4.6 (Thinking Max) 的差距拉開到雙位數百分比,顯示 AI 推理能力正出現結構性變化,競爭也越趨激烈。
Gemini 3 Deep Think 的定位並不是通用聊天優化,而是專攻「長鏈條推理」與「抽象規則建構」。這意味著它更強調多步驟推導過程的穩定性,以及在未知題型下的泛化能力。
過去大型語言模型在面對高階數學證明、理論物理推導或複雜演算法設計時,往往會在中途出現邏輯斷裂。Deep Think 的設計核心,就是降低這種「推理中斷」現象,使模型在長距離思考過程中維持一致性。這也是為什麼它的突破主要體現在抽象推理與奧林匹克等級測試上,而非單純語言流暢度。
ARC-AGI-2 是目前極具代表性的抽象推理測試之一,考驗模型在完全陌生規則下歸納模式的能力,而不是資料記憶。以下為官方數據整理:
| 模型 | ARC-AGI-2 |
|---|---|
| Gemini 3 Deep Think | 84.6% |
| Claude Opus 4.6 (Thinking Max) | 68.8% |
| GPT-5.2 | 52.9% |
| Gemini 3 Pro Preview | 31.1% |
Deep Think 與 Claude Opus 4.6 之間出現接近 16 個百分點差距。對於這類高難度測試而言,這不是微幅提升,而是能力等級的跨越。這說明 Deep Think 在抽象規則建構與推理泛化方面已有明顯強化。
如果 ARC-AGI-2 測試的是抽象規則理解,那麼奧林匹克等級理論測試考驗的就是完整推導能力與邏輯嚴謹度。以下為 2025 年理論類測試成績整理:
| 測試項目 | Deep Think | Claude Opus 4.6 |
|---|---|---|
| International Math Olympiad 2025 | 81.5% | – |
| International Physics Olympiad 2025 (theory) | 87.7% | 71.6% |
| International Chemistry Olympiad 2025 (theory) | 82.8% | – |
特別是在 Physics 理論測試中,差距超過 16 個百分點。這代表模型在多步驟公式推導與條件控制方面的穩定性明顯提升。這類能力對科研、工程模擬與高等教育應用尤為重要。
在 Codeforces 無工具測試中,Gemini 3 Deep Think 取得 3455 Elo,屬於極高競技水準,代表模型在演算法設計、邊界條件處理與錯誤控制上具備更強穩定度。對於工程團隊而言,這種差距意味著更少的邏輯修補與更高的一次成功率。
| 模型 | Codeforces Elo |
|---|---|
| Gemini 3 Deep Think | 3455 |
| Gemini 3 Pro Preview | 2512 |
| Claude Opus 4.6 | 2352 |
如果將多項測試放在一起觀察,可以看到 Deep Think 並非只在單一項目勝出,而是在多個高階推理場景中穩定領先。
| Benchmark | Deep Think | Claude Opus 4.6 |
|---|---|---|
| ARC-AGI-2 | 84.6% | 68.8% |
| Humanity’s Last Exam | 48.4% | 40.0% |
| MMMU-Pro | 81.5% | 73.9% |
| CMT Benchmark | 50.5% | 17.1% |
這個強大的模型目前只開放給 Google AI Ultra 的訂閱使用者使用,AI Pro 的使用者也可以期待 Google 早日開放。另外如果你是研究人員、工程師或企業代表的話,也可以向 Google 提出體驗申請,就可以透過 Gemini API 使用 Gemini 3 Ultra 的超強性能。
Codeforces Elo不是一般網頁或軟體開發競賽,這個競賽的主要項目是演算法程式設計(Competitive Programming),要求參賽者在限時內,針對特定的邏輯、數學或資料結構問題,撰寫出能在規定時間與記憶體限制內跑出正確結果的程式碼。在 AI 模型上主要用於衡量大語言模型(LLM)的高難度邏輯推理與程式撰寫能力。
積分最高等級為 3000+ 的 Legendary Grandmaster (黑紅雙色)
目前只開放給 Google AI Ultra 的訂閱使用者使用,AI Pro 的使用者也可以期待 Google 早日開放。另外如果你是研究人員、工程師或企業代表的話,也可以向 Google 提出體驗申請,就可以透過 Gemini API 使用 Gemini 3 Ultra 的超強性能。
Google 行事曆解除 11 色限制,開放全彩行事曆顏色,提升時間管理效率
AI筆電就能跑:Google Gemma 4 12B 登場,效能直追 26B 模型
AI駕馭 Claude Code 的百萬 Token。5 招提升 AI 程式設計效率
AI 服務紅利期進入尾聲:運算成本飆升,Claude、Google、X.AI 陸續收緊使用限制
AI國際AI工具進台灣卡在發票 歐買尬出手
AI國際AI工具進台灣卡在發票 歐買尬出手
AIAI 變身最強駭客?Anthropic 發表未公開模型 Claude Mythos,找到 27 年未被發現的漏洞
AIAnthropic 攜手 Google、博通豪砸 3.5 GW 算力佈局 AI 算力
AI影片生成「白菜價」時代來臨!Google 推 Veo 3.1 Lite 影片生成模型,每秒只要 0.05 美元
AIClaude Code 原始碼外洩,究竟 Anthropic 是如何實現 Harness,讓 coding agent 可以穩定長時間運作?
手哥 HANDBRO 硬是要學共同創辦人兼職打雜編輯,熱愛網路、熱愛 3C!腦袋是個不定時炸彈,隨時會炸出新玩意兒!如有開箱、評測或各種合作需求,請洽:contact@soft4fun.net。 YouTube 頻道:手哥科科 《手哥科科》YouTube 頻道 從電視的大螢幕到手機的小螢幕,要維持一致的顯示色彩也是不容易的事情,三星這個 Demo 讓大家知道它們做得到 #computex2026 00:22 HKC 在 #Computex 上推出的全球首款 83.4 吋 12K 超寬曲面螢幕,這款螢幕的寬度寬到兩邊都還要用支撐架來輔助穩定。但這個體驗真的相當讚,臨場感滿分。 00:19 不用一直盯小孩!SpotCam BabyCam Pro 實測:AI 偵測、5 吋螢幕、24 小時雲端錄影一次看 12:36 過年春節拍照手機空間不夠? 用這招讓你不會錯失任何一個珍貴畫面!#pCloud 春節42折優惠 03:56 比架 NAS 還划算!pCloud 雲端硬碟,付一次費終身使用!雙11限定38折! 05:58在我的瀏覽器中保存我的姓名,電子郵件和網站,以便下次評論。
新文章使用電子郵件通知我。