-
2026 年 06 月 11 日Google 於今日帶來了一項顛覆性的突破,正式推出實驗性開源模型 DiffusionGemma。這款模型捨棄了我們熟悉的逐字生成模式,導入了極速的「文字擴散技術(Text Diffusion)」技術,在特定硬體上實現了高達 4 倍的推論速度提升。
傳統的自迴歸模型(Autoregressive Models)就像一台打字機,必須從左到右、一個 Token 接著一個 Token 順序生成。在雲端伺服器高併發的環境下,這種模式非常高效;但當我們在本地端單點運行時,GPU 大部分的時間其實都在等待下一個「按鍵」的觸發,導致算力嚴重閒置。
DiffusionGemma 完全反轉了這個低效現象。它採用了類似 AI 圖像生成的「擴散模型」邏輯:
這就如同把單調的打字機升級成了「大規模印刷機」,一次印出整段文字,讓你的專屬 GPU 能夠火力全開。
▲ 圖片生成模型也是採用「擴散」技術來生成DiffusionGemma 的基礎建立在 Gemma 4 家族優異的參數性價比之上,其帶來的商業與應用價值主要體現在以下三點:
透過將解碼瓶頸從記憶體頻寬轉移到運算核心,DiffusionGemma 在單張 NVIDIA H100 上每秒可生成超過 1000 個 Token;而在消費級的 NVIDIA GeForce RTX 5090 上,也能跑出每秒 700+ Token 的傲人成績。
採用 26B 總參數量的混合專家模型(MoE)架構,在推論期間實際上只會啟動 3.8B 的參數。這意味著在量化(Quantized)處理後,它能輕鬆塞進 18GB VRAM 的消費級高階顯卡中,大幅降低了個人開發者的硬體門檻。
因為一次能處理 256 個 Token,模型在生成時具備「雙向注意力(Bi-directional attention)」。這讓它在處理傳統模型不擅長的非線性任務時如魚得水,例如:程式碼中段填補(In-filling)、胺基酸序列解析、甚至是破解「數獨」。它能在生成過程中統觀全局,即時自我修正錯誤。
雖然速度極快,但 Google 官方也坦言這是一款針對「速度極致妥協」的實驗性模型。以下是給開發者的應用建議:
DiffusionGemma 目前採用友善的 Apache 2.0 授權於 Hugging Face 上架。為了幫助開發者快速上手,Google 提供了一系列的支援:
DiffusionGemma 的出現,象徵著邊緣運算與本地 AI 應用邁入了一個新的里程碑。用速度換取更高的互動性,將讓未來的寫作輔助、即時程式碼生成等工具變得更流暢無感。對於喜歡浸淫硬體與新技術的開發者來說,這絕對是今年必玩的開源模型之一!
相關資源:
筆電就能跑:Google Gemma 4 12B 登場,效能直追 26B 模型
AI 服務紅利期進入尾聲:運算成本飆升,Claude、Google、X.AI 陸續收緊使用限制
AIGoogle 釋出最強開源模型 Gemma 4,五大亮點與開發者應用全解析
AIGoogle 開源 AI 模型 Gemma 開放下載,筆電桌機都能流暢順跑!
手哥 HANDBRO 硬是要學共同創辦人兼職打雜編輯,熱愛網路、熱愛 3C!腦袋是個不定時炸彈,隨時會炸出新玩意兒!如有開箱、評測或各種合作需求,請洽:contact@soft4fun.net。 YouTube 頻道:手哥科科 《手哥科科》YouTube 頻道 從電視的大螢幕到手機的小螢幕,要維持一致的顯示色彩也是不容易的事情,三星這個 Demo 讓大家知道它們做得到 #computex2026 00:22 HKC 在 #Computex 上推出的全球首款 83.4 吋 12K 超寬曲面螢幕,這款螢幕的寬度寬到兩邊都還要用支撐架來輔助穩定。但這個體驗真的相當讚,臨場感滿分。 00:19 不用一直盯小孩!SpotCam BabyCam Pro 實測:AI 偵測、5 吋螢幕、24 小時雲端錄影一次看 12:36 過年春節拍照手機空間不夠? 用這招讓你不會錯失任何一個珍貴畫面!#pCloud 春節42折優惠 03:56 比架 NAS 還划算!pCloud 雲端硬碟,付一次費終身使用!雙11限定38折! 05:58在我的瀏覽器中保存我的姓名,電子郵件和網站,以便下次評論。
新文章使用電子郵件通知我。