把 CFO、COO、法务顾问等高管职责分配给 8 个 AI 智能体,对用户却只呈现一位高管口吻的开源系统 Open Executive 正在引发关注。开发方是从事多智能体系统的 Sente Labs,许可证为 Apache 2.0,设计前提是部署在自己的服务器上,并让它读取本公司的资料。
8 个专业智能体,对外只是一位「高管」
Open Executive 在设计上最值得注意的一点,是内部结构从不暴露给用户。提问首先进入名为 Executive Orchestrator 的调度层,它根据内容并行调用所需的专业智能体,再把各方意见整合成一份回答。用户看到的始终是同一个人格的高管在回应。
职责划分覆盖 8 个领域。首席战略官负责竞争分析、并购和目标管理,首席财务官处理财务建模、融资与单位经济效益。首席人力资源官负责招聘、薪酬与企业文化,法务顾问处理合同、知识产权与合规。首席运营官负责流程设计与供应商管理,首席营销官负责市场进入策略与品牌,首席产品官负责路线图与优先级排序,董事会传播总监则承担董事会材料与投资者关系。
模型的分配同样按角色区分。默认使用 claude-sonnet-4-6,但战略、财务、法务、董事会这 4 个领域会调用带扩展思考的 claude-opus-4-7。把昂贵的模型只留给判断分量最重的领域,是相当务实的设计。
让「你上个月是这么说的」成立的记忆机制
与普通聊天机器人的最大区别,在于跨会话保留的记忆。每次生成回答之后,后台会运行 claude-haiku-4-5,从对话中提取已确定的事项、进行中的举措和给出的建议,写入 SQLite。下一次会话开头会插入一段过去决策的内容,因此可以承接上个月的讨论继续往下谈。
知识侧是两层结构。一层是以 Markdown 形式内置的 MBA 级内容,启动时导入向量数据库 ChromaDB。另一层是用户上传的公司资料,无论是路演材料、财务模型还是战略文档,都会被切分并保存到独立的集合中,只在相关提问时被检索。取回的内容会混入用户发言而非系统提示词,正是为了不破坏缓存。
缓存本身也做了细致处理。高管人格、公司档案和知识索引分别缓存,据称在对话进行几轮之后命中率最高可达 85%。对话越长,成本上的效果越明显。
也可以选择不使用 Claude
看上去似乎必须依赖 Anthropic 的模型,实际上没有 API 密钥也能运行。只要指定 Ollama、LM Studio、vLLM、llama.cpp 等兼容 OpenAI 接口的本地服务器,从调度层到专业智能体都可以跑在本地模型上。也支持通过 OpenRouter 接入其他厂商的模型,做成高管用 Claude、个别专家用本地模型的混合配置。
不过限制写得很清楚。服务端网络搜索、提示词缓存和扩展思考在本地模型上无法使用。此外,这套机制依靠调度层通过工具调用来挑选专家,如果换成不擅长工具调用的小模型,分派本身就会失败。跑起来不难,但回答质量会直接反映模型的选择。
用 CI 给经营建议打分
关于建议质量如何保证,项目准备了评测套件。其中包含覆盖 8 个领域的 29 个场景,每个场景都定义了模拟的公司状况、应涉及的议题、应被调用的专家以及评分标准。评分方是 claude-opus-4-7,从人格一致性、专业准确度、公司语境利用、分派质量、可执行性 5 个维度按 5 级打分。
平均分低于 3.5 就无法通过 CI,任何一项相比 main 分支下降超过 10% 的拉取请求都会被驳回。新增专业智能体时,也要求附上至少 2 个评测场景。对经营建议这种容易主观化的输出,长期挂着由模型评分的回归测试,在同类项目中并不多见。
部署成本与交出去的信息
技术栈是 Python 3.11 以上的 FastAPI 加 Next.js 15。克隆仓库、设置一个环境变量,再执行 make 命令即可启动。首次启动会因为下载嵌入模型而花上几分钟,之后就会快很多。
git clone https://github.com/SenteLabsAI/OpenExecutive.git
cd OpenExecutive
cp .env.example .env
make dev
入口不只有 Web 界面。Slack、邮件、Telegram、Google Chat、Discord 以及命令行都能与同一位高管对话。在 Discord 上除了提及之外,还支持斜杠命令提问。
比较让人在意的是把公司资料交出去这一点。公司档案、上传的文档和向量数据库的内容全部被排除在版本控制之外,只留在本地或自己准备的云端卷上。真正外发的只有送往 Anthropic API 的那部分提示词。当然,这毕竟是一套以完整读取财务模型和董事会材料为前提的系统,交到什么程度仍然需要使用方自己划线。
总结
与其说 Open Executive 是让 AI 代替经营,不如说它提供了一个随时待命、且了解本公司语境的顾问。GitHub 上在本文更新时已积累 3,246 个星标和 306 次复刻,Apache 2.0 许可也允许商用。比起 8 个专业智能体的构成本身,更能看出这类工具走向成熟的,是它在记忆和评测上下的功夫。
