-
2024 年 03 月 25 日用「說」的就能做出 UI 的時代快來了!Google 最近發表 ScreenAI 模型,結合視覺與語言處理能力,針對使用者介面和資訊圖表提供深度解析,並把每個 UI 元件拆解出來,雖然目前 AI 模型只能「解讀」,但未來搭配生成式 AI 模型,能做的事情可就多了!
ScreenAI 採用了視覺語言模型 PaLI 的架構,透過多模態編碼器和自回歸解碼器組成,利用視覺 Transformer 創建圖像嵌入並結合文字資訊,使模型能同時理解圖片與相關文字。其採用的彈性區塊處理策略,讓 ScreenAI 能夠更好地處理不同長寬比的圖片,強化了模型的處理能力。
ScreenAI 的架構是基於 PaLI,由多模態編碼器區塊和自回歸解碼器組成,在 PaLI 架構之上,Google 採用了 pix2struct 的靈活修補策略 (flexible patching strategy)而非使用固定網格圖案,選擇網格尺寸以保留輸入影像的原始縱橫比。這使得 ScreenAI 能夠在各種長寬比的影像上正常運作。
ScreenAI 的訓練分為預訓練與微調兩階段。預訓練階段採用自監督學習生成資料標籤,用於訓練視覺與語言模型,微調階段則凍結 ViT 參數,使用人工標記的資料進行微調,以提高對特定任務的表現。訓練資料集來自不同裝置的螢幕截圖,涵蓋多樣的視覺樣式與使用者介面元素。
▲ SceenAI 模型架構ScreenAI 會自動根據畫面的比例將畫面切成網格結構進行分析,識別出畫面的結構、配置,甚至 UI 元件的組合,並且以文字的方式描述 UI 的配置、元素內容。
未來這個 AI 模型可以透過學習不同來源的畫面配置、設計風格,未來只要再搭配生成式 AI 模型,就能夠只下指令 (prompt) 就可以做出各種不同的 UI!
▲ 一張螢幕截圖,由 ScreenAI 自動產生畫面註記以及 UI 元件配置 (圖/Google Research)Google 行事曆解除 11 色限制,開放全彩行事曆顏色,提升時間管理效率
AI筆電就能跑:Google Gemma 4 12B 登場,效能直追 26B 模型
AI 服務紅利期進入尾聲:運算成本飆升,Claude、Google、X.AI 陸續收緊使用限制
AI國際AI工具進台灣卡在發票 歐買尬出手
AI國際AI工具進台灣卡在發票 歐買尬出手
AIAI 變身最強駭客?Anthropic 發表未公開模型 Claude Mythos,找到 27 年未被發現的漏洞
AI影片生成「白菜價」時代來臨!Google 推 Veo 3.1 Lite 影片生成模型,每秒只要 0.05 美元
AIClaude Code 原始碼外洩,究竟 Anthropic 是如何實現 Harness,讓 coding agent 可以穩定長時間運作?
AI別只寫 Prompt!先工程化你的 AI 協作系統
AIGoogle 推出 Agent Skills,讓 Gemini 3.1 Pro 開發成功率上升至 96.6%
手哥 HANDBRO 硬是要學共同創辦人兼職打雜編輯,熱愛網路、熱愛 3C!腦袋是個不定時炸彈,隨時會炸出新玩意兒!如有開箱、評測或各種合作需求,請洽:contact@soft4fun.net。 YouTube 頻道:手哥科科 《手哥科科》YouTube 頻道 從電視的大螢幕到手機的小螢幕,要維持一致的顯示色彩也是不容易的事情,三星這個 Demo 讓大家知道它們做得到 #computex2026 00:22 HKC 在 #Computex 上推出的全球首款 83.4 吋 12K 超寬曲面螢幕,這款螢幕的寬度寬到兩邊都還要用支撐架來輔助穩定。但這個體驗真的相當讚,臨場感滿分。 00:19 不用一直盯小孩!SpotCam BabyCam Pro 實測:AI 偵測、5 吋螢幕、24 小時雲端錄影一次看 12:36 過年春節拍照手機空間不夠? 用這招讓你不會錯失任何一個珍貴畫面!#pCloud 春節42折優惠 03:56 比架 NAS 還划算!pCloud 雲端硬碟,付一次費終身使用!雙11限定38折! 05:58在我的瀏覽器中保存我的姓名,電子郵件和網站,以便下次評論。
新文章使用電子郵件通知我。