NVIDIA推出了一套名為「Metropolis代理技能」的可重複使用工作流程以及藍圖(blueprint),讓開發者能更快地建構視覺AI代理,把工廠、城市與倉庫等現場的影片轉化為可用於營運的判斷[1]。此方案搭配透過OpenUSD與NVIDIA Omniverse進行的合成資料生成,目標是補足三大缺口:訓練資料不足、缺乏微調(fine-tuning)經驗,以及建構過程的複雜度。Roboflow、Linker Vision與富士康(鴻海)等合作夥伴都已回報了具體成果。

視覺AI代理面臨的三道關卡

視覺AI代理是一種能理解攝影機與感測器所擷取影片、並依現場狀況轉化為判斷與警示的系統。把它們部署在更接近資料生成位置的邊緣端的趨勢正在加速。研究機構Gartner預測,到2028年企業所管理資料的三分之二以上將在資料中心或雲端之外被生成與處理,導入邊緣AI的企業比例也將從2025年的10%成長到2029年的全球三分之二以上[1]。與此同時,有觀點指出現有邊緣資料中高達90%仍未被處理與運用[1]。

NVIDIA列舉了建構這類代理時容易卡關的三個環節[1]。第一是訓練資料不足造成的準確度瓶頸。例如生產線上的檢測模型,能辨識常見的刮痕與凹陷,卻往往會漏掉訓練資料中沒有的新型細微裂痕。第二是缺乏微調經驗。即使找出了效能短板,也需要準備帶標註的資料、設定訓練、進行評估等工序,而許多企業並沒有大規模的內部機器學習團隊。第三是建構工作的複雜度。開發者必須把影片處理管線、模型、搜尋、警示與報告等拼接在一起,針對每個環境的客製化都要耗費大量時間與專業知識。

讓合成資料與微調可重複使用的「代理技能」

這次推出的代理技能與藍圖為開發者提供了可重複使用的起點,無須從零重建這些工序[1]。在模擬與合成資料方面,基礎是能以統一框架描述並重複使用3D空間的OpenUSD(Universal Scene Description),以及建構於其上的NVIDIA Omniverse函式庫。團隊可以在數位分身(digital twin)中重現照明、天氣、交通流、攝影機角度、遮蔽以及罕見事件等各種條件,藉此擴展可用於訓練的情境範圍[1]。

這些技能依用途劃分[1]。包括用於生成合成瑕疵影像的「Defect Image Generation」技能、提升情境涵蓋度的「Video Data Augmentation」技能、負責模型微調的「NVIDIA TAO」技能,以及把影片搜尋與摘要落實為警示、報告、串流管理等營運流程的「VSS(影片搜尋與摘要)」技能。與NVIDIA Omniverse和Metropolis搭配使用,可以讓從資料生成到模型改善、再到代理部署的整套工作更有效率。

在製造、智慧城市與工業現場的成果

在製造業,工廠越是成功地防止瑕疵發生,就越難蒐集到訓練下一代檢測模型所需的瑕疵樣本[1]。Roboflow把NVIDIA的Defect Image Generation技能與NVIDIA Cosmos(世界基礎模型)整合到自家的視覺AI平台,在真實資料稀少時生成合成瑕疵影像。在與光纖廠商康寧(Corning)工程團隊進行的基準測試中,僅用8張真實瑕疵影像並補充合成資料所訓練出的模型,在最困難的瑕疵類別上達到了95%的平均準確率與完美的召回率,超越了僅以真實資料訓練的基線模型。NVIDIA表示,這把原本需要數個季度的檢測專案壓縮到僅僅幾天[1]。

在智慧城市領域,Linker Vision使用面向VSS的NVIDIA Metropolis藍圖,把解讀影片的代理部署到整個城市基礎設施[1]。以OpenUSD為基礎的Omniverse數位分身重現城市環境,方便團隊測試系統對交通、天氣與緊急事件的反應。在台灣高雄,藉助該VSS藍圖把開發工作量削減了85%,並把事件回應時間最多縮短了80%。後續的AI-GRID擴充採用了面向安全代理型AI的NVIDIA NemoClaw藍圖[1]。

在工業現場的成果

在工業現場,關鍵不只是偵測影片畫面中出現了什麼,還要理解作業是否被正確執行[1]。在富士康,DeepHow的「Live SOP(標準作業程序)驗證」代理把NVIDIA Metropolis的VSS藍圖作為搜尋、摘要與分析的底層,並仰賴NVIDIA Cosmos來進行結合上下文解讀人工作業步驟的推理。在NVIDIA GB300伺服器生產線上部署後,它把首次通過良率提升了3%,在關鍵作業步驟的細微動作理解上達到99%的準確度,並透過更早發現問題減少了重工[1]。

總結

NVIDIA的代理技能與藍圖把視覺AI工作的各個階段——合成資料生成、模型微調、代理部署——打包成可重複使用的模組,讓即使沒有專業團隊的企業也能加速開發。這次的看點在於現場成果都以具體數字呈現,從Roboflow僅憑8張真實影像實現的高準確度,到高雄削減85%開發工作量,再到富士康的良率提升。隨著在邊緣執行的AI邁向實用階段,降低開發門檻的基礎正在逐步成形。

出典:https://blogs.nvidia.com/blog/vision-ai-agent-skills-omniverse-metropolis/