Google 發表了一款只在本機筆電上就能執行、無須連上雲端的新開放模型「Gemma 4 12B」[1]。它雖然約有 120 億個參數,卻能在配備 16GB 記憶體的機器上於本機執行,除了文字之外,還能直接處理影像、音訊與影片。模型權重以 Apache 2.0 授權免費公開,可望擴大這種不必把資料上傳雲端、在本機即可完成的私密 AI 應用的普及範圍。

可在 16GB 筆電上執行的輕量開放模型

Gemma 4 12B 是 Google 在 6 月推出的 AI 相關更新之一[1]。如果說 Gemini 負責雲端一側的頂級模型,那麼 Gemma 就屬於無須連網、可在裝置本機執行的「開放模型」系譜。

它最大的賣點,是無須專用伺服器或 GPU,只要一台配備約 16GB 記憶體的一般筆電就能執行[1]。模型規模約為 120 億個參數(12B),與大型雲端專用模型相比屬於較為精簡的一類[3]。即便如此,它仍能在本機完成高階推理,因此在處理不能外流的資料、或在網路環境不穩定的現場使用時,都具有實用的優勢[1]。

在散布方面同樣開放。權重以 Apache 2.0 授權免費公開,可從 Hugging Face 與 Kaggle 取得[3]。執行環境也支援 vLLM、llama.cpp 等標準執行框架,並已可在 LM Studio、Ollama 這類便利的本機執行工具中使用,方便開發者整合到自己的環境中[3]。

沒有編碼器的「整合」架構

Gemma 4 12B 在技術上的亮點,是 Google 稱之為「整合(unified)」的無編碼器設計[2]。傳統的多模態模型通常先用專用的轉換模組(編碼器)處理影像與音訊,再把結果交給核心語言模型。編碼器往往會增加記憶體與處理時間的負擔,也是拖慢執行速度的因素之一。

Gemma 4 12B 省去了這道中間處理,把音訊波形與影像資料直接送入核心語言模型[3]。如此一來,它能在同一套機制中直接處理文字、影像、音訊與影片。Google 將其定位為一款無須經過專用編碼器即可處理音訊與影片的中等規模開放模型[2][3]。

它一次能讀入的資訊量也很大,脈絡視窗(context window)達到 25.6 萬個詞元(256K)[3]。這足以把冗長的會議逐字稿、大規模原始碼或篇幅較多的資料一次放入工作記憶體,就本機執行的模型而言,可處理素材的範圍相當廣。

目標是可在本機執行的 AI 代理

Google 將 Gemma 4 12B 描述為實現「在筆電上執行的智慧 AI 代理」的基礎[1]。透過把視覺與原生的音訊處理整合到同一套精簡的機制中,它力求在日常硬體上也能兼顧高階推理與保護隱私的工作方式,而不犧牲速度[1]。

其背後是對在本機裝置上執行 AI 的「端側 AI」日益升高的關注。只要不把處理交給雲端,就能降低機密資訊外流的風險,也能減輕通訊費與使用費的負擔。散布開放權重的模型便於企業與開發者整合到自有環境中用於這類場景,Gemma 4 12B 正是順應這股趨勢的一步。

不過,這裡提到的效能與特性,目前主要是根據 Google 自身的說明。實際的使用體驗與精確度,要等到第三方的驗證與基準測試逐漸齊備後才會有定論。由於開放模型的一大優點是任何人都能在本機試用,公開之後的實測與比較將成為下一個關注焦點。

總結

Gemma 4 12B 是一款約 120 億個參數、即使在配備 16GB 記憶體的筆電上也能執行的開放模型,並以 Apache 2.0 授權免費公開。得益於沒有編碼器的整合架構,它不僅能處理文字,還能在同一套機制中處理影像、音訊與影片,並支援 25.6 萬個詞元的寬廣脈絡。它能否作為不依賴雲端、在本機執行的 AI 代理基礎,在開發者與重視隱私的場景中扎根,值得關注。

出典:https://blog.google/innovation-and-ai/technology/ai/google-ai-updates-june-2026/

出典:https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12b/

出典:https://venturebeat.com/technology/googles-new-open-source-gemma-4-12b-analyzes-audio-video-and-runs-entirely-locally-on-a-typical-16gb-enterprise-laptop