把財務長、營運長、法務顧問等高階主管的職責分配給 8 個 AI 代理,對使用者卻只呈現一位主管口吻的開源系統 Open Executive 正引發關注。開發者是投入多代理系統的 Sente Labs,授權為 Apache 2.0,設計前提是架在自己的伺服器上,並讓它讀取自家公司的資料。
8 個專業代理,對外只是一位「主管」
Open Executive 在設計上最值得留意的一點,是內部架構從不揭露給使用者。提問先進入名為 Executive Orchestrator 的調度層,依內容平行呼叫需要的專業代理,再把各方意見整合成一份回答。使用者看到的始終是同一個人格的主管在回應。
職責劃分涵蓋 8 個領域。策略長負責競爭分析、併購與目標管理,財務長處理財務模型、募資與單位經濟效益。人資長負責招募、薪酬與企業文化,法務顧問處理合約、智慧財產與法遵。營運長負責流程設計與供應商管理,行銷長負責上市策略與品牌,產品長負責產品藍圖與優先順序,董事會溝通總監則承擔董事會資料與投資人關係。
模型的分配同樣依角色而定。預設使用 claude-sonnet-4-6,但策略、財務、法務、董事會這 4 個領域會呼叫帶延伸思考的 claude-opus-4-7。把昂貴的模型只留給判斷分量最重的領域,是相當務實的設計。
讓「你上個月是這麼說的」成立的記憶機制
與一般聊天機器人最大的差別,在於跨工作階段保留的記憶。每次產生回答之後,背景會執行 claude-haiku-4-5,從對話中萃取已定案的事項、進行中的專案與給過的建議,寫入 SQLite。下一次開啟時,開頭會插入一段過去決策的內容,因此可以接著上個月的討論繼續談。
知識端是兩層結構。一層是以 Markdown 內建的 MBA 等級內容,啟動時匯入向量資料庫 ChromaDB。另一層是使用者上傳的公司資料,無論是募資簡報、財務模型還是策略文件,都會被切分後存進獨立的集合,只在相關提問時被檢索。取回的內容會混進使用者的發言而非系統提示,正是為了不破壞快取。
快取本身也做得相當細緻。主管人格、公司檔案與知識索引各自分開快取,據稱在對話進行幾輪之後,命中率最高可達 85%。對話愈長,在成本上的效果就愈明顯。
也可以選擇不使用 Claude
看起來像是必須依賴 Anthropic 的模型,實際上沒有 API 金鑰也能運作。只要指定 Ollama、LM Studio、vLLM、llama.cpp 等相容 OpenAI 介面的本機伺服器,從調度層到專業代理都能跑在本機模型上。也支援透過 OpenRouter 接上其他廠商的模型,做成主管用 Claude、個別專家用本機模型的混合配置。
不過限制寫得很清楚。伺服器端的網路搜尋、提示快取與延伸思考在本機模型上無法使用。此外,這套機制仰賴調度層以工具呼叫來挑選專家,若換成不擅長工具呼叫的小型模型,分派本身就會失準。跑起來不難,但回答品質會直接反映模型的選擇。
用 CI 為經營建議打分數
關於建議品質如何把關,專案準備了評測套件。其中包含涵蓋 8 個領域的 29 個情境,每個情境都定義了模擬的公司狀況、應觸及的議題、應被呼叫的專家以及評分準則。評分者是 claude-opus-4-7,就人格一致性、專業正確度、公司脈絡運用、分派品質與可執行性 5 個面向,以 5 級評分。
平均低於 3.5 分就無法通過 CI,任何一項相較 main 分支下滑超過 10% 的合併請求都會被擋下。新增專業代理時,也要求附上至少 2 個評測情境。對經營建議這種容易流於主觀的產出,長期掛著由模型評分的迴歸測試,在同類專案中並不常見。
部署成本與交出去的資訊
技術堆疊是 Python 3.11 以上的 FastAPI 搭配 Next.js 15。複製儲存庫、設定一個環境變數,再執行 make 指令即可啟動。首次啟動會因為下載嵌入模型而花上幾分鐘,之後就會快得多。
git clone https://github.com/SenteLabsAI/OpenExecutive.git
cd OpenExecutive
cp .env.example .env
make dev
入口不只有網頁介面。Slack、電子郵件、Telegram、Google Chat、Discord 以及命令列都能與同一位主管對話。在 Discord 上除了提及之外,也支援斜線指令提問。
比較讓人在意的是把公司資料交出去這一點。公司檔案、上傳的檔案與向量資料庫的內容全部被排除在版本控制之外,只留在本機或自己準備的雲端磁碟區上。真正外送的只有傳往 Anthropic API 的那部分提示。話雖如此,這畢竟是一套以完整讀取財務模型與董事會資料為前提的系統,要交到什麼程度,仍需由使用方自行劃線。
總結
與其說 Open Executive 是讓 AI 代替經營,不如說它提供了一位隨時待命、而且了解自家脈絡的顧問。GitHub 上在本文更新時已累積 3,246 顆星與 306 次分叉,Apache 2.0 授權也允許商用。比起 8 個專業代理的組成本身,更能看出這類工具走向成熟的,是它在記憶與評測上下的功夫。
