AIエージェントが答えを返すまでには、モデルの呼び出し、検索、ツール実行といった処理が何段にも積み重なっています。その一連の流れを木構造で記録し、どの段階でどれだけトークンと時間を使ったのかまで画面から追えるオープンソースの基盤が「Langfuse」です。MITライセンスで公開されており、自社サーバーに置いて運用することもできます。

動いた結果しか見えない、という不便

エージェント型のアプリでやっかいなのは、出力がおかしかったときに原因の切り分けが難しい点です。モデルの推論が外れたのか、検索が的外れな文書を拾ってきたのか、それとも呼び出すツールの選択を間違えたのか。返ってきた文章だけを眺めていても、どこで話がねじれたのかは分かりません。

コストの問題も同じ構図です。請求額は月末にまとまって届きますが、その内訳がどの機能のどの処理に紐づいているのかは、アプリ側で記録していなければ後から復元できません。指示の書き方を少し変えただけで消費トークンが跳ね上がることも珍しくなく、実運用では無視できない差になります。

Langfuseは、この見えない部分を実行単位で丸ごと保存するところから始めます。

1回の応答を階層構造で保存する

Langfuseが扱う中心的な単位はトレースです。利用者の入力から最終的な出力までを1本のトレースとして扱い、その内側にモデル呼び出しや検索、ツール実行といった処理を入れ子で並べます。

各処理には入力と出力の内容に加えて、所要時間、消費トークン数、推定コストが記録されます。ツールを呼んだ場合は、渡した引数と返ってきた結果も残ります。利用者やセッション、独自に付けたメタデータで絞り込めるため、特定の顧客だけで起きている不具合や、遅延の大きい経路を後から探しにいけます。

記録は非同期でまとめて送られる設計で、アプリ本体の応答を待たせません。8月に公開されたバージョン4では、この収集と表示がリアルタイム寄りに作り直され、条件によっては従来の165倍の速さで扱えるとしています。

観測して終わらせず、改善まで同じ場所で回す

Langfuseが単なる記録ツールと違うのは、集めたデータをそのまま改善の材料として使える点です。

プロンプトはコードから切り離して保存でき、バージョン管理と切り戻しができます。回答の品質は、別のモデルに採点させる方法、決められた計算式で判定する方法、人が目視で確認する方法のいずれでも評価できます。本番で拾った入力をそのままデータセットにして、モデルやプロンプトを差し替えた結果を横並びで比べる実験機能もあります。8月下旬には評価ルールを使い回せる仕組みや、採点結果をダッシュボードのグラフに載せる機能が追加されました。

最近はコーディングAIから触る導線も整っています。ターミナルから全機能を叩けるコマンドラインツールが8月21日に正式版となり、開発環境のエージェント向けにはMCPサーバーが用意されています。本番データの調査からその場で対処までを担当する画面内のアシスタント機能も搭載されました。

OpenTelemetry準拠で、囲い込まない

連携先の広さも特徴です。LangfuseはOpenTelemetryに準拠しており、これに対応した言語やフレームワークであればそのまま計測できます。Python と TypeScript には専用のSDKがあり、Go、Java、.NET、Ruby、PHP、Swift はOpenTelemetry経由で扱えます。

用意されている統合は100種類を超えます。LangChain、Vercel AI SDK、LiteLLM、Pydantic AI、Google ADK、CrewAI といったエージェント基盤、OpenAI、Anthropic、Google Gemini、Mistral AI、xAI、Amazon Bedrock、Groq、vLLM、Ollama などのモデル提供元、さらに Dify、n8n、OpenWebUI、Cursor、Claude Code といった手元のツールまで含まれます。特定の枠組みに縛られないという設計方針が、そのまま対応表に出ています。

データの持ち出しも塞いでいません。全機能をREST APIから操作でき、クエリ用のSDKやS3互換ストレージへの書き出しも用意されています。

自社サーバーに置くという選択

Langfuseは製品機能のすべてがMITライセンスで公開されています。手軽に試すならDockerでまとめて立ち上げるのが早く、リポジトリを取得してコンテナを起動するだけで動きます。

git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose up -d

本番運用向けには Kubernetes 向けの Helm チャートに加えて、AWS、GCP、Azure それぞれの Terraform 構成も提供されています。内部ではClickHouseを集計用のデータベースとして使い、取り込みはキューを挟んで非同期に処理し、容量の大きい入出力はオブジェクトストレージへ逃がす構成です。トレースが数億件に膨らんでも扱えるように組まれています。

クラウド版もあり、無料枠は月5万件の記録まで、クレジットカードの登録なしで使えます。セキュリティ面では SOC 2 Type II と ISO 27001 に対応し、米国・EU・日本のデータリージョンと、医療情報を扱うための構成が選べます。

開発元のLangfuseは、ClickHouseの傘下に入っています。GitHubのスターは3万件を超え、貢献者は300人を上回ります。同社の公表値では、月間100億件を超える観測データを処理し、2,300社以上が利用しているとしています。

まとめ

エージェントを組んだ直後は動いたかどうかで一喜一憂しがちですが、実際に運用へ乗せると、なぜそうなったのかを説明できる仕組みの有無が効いてきます。Langfuseは、実行経路の記録から評価、プロンプトの管理までを1つの土台にまとめ、しかもMITライセンスで自社に置ける形で提供しています。手元のエージェントが何にトークンを使っているのか把握できていないなら、まず記録から始める価値は十分にあります。