AT&Tが社内で使うAIの費用を、用途に応じたモデルの使い分けで大きく圧縮しています。コーディング関連の一部作業では最大56パーセントのコスト削減を達成し、品質の低下は2パーセントにとどまったとされます。同社の社内AI基盤は1日あたり450億トークンを処理しており、そのうち約4割がすでにオープンモデル側へ流れています。
「どれが一番賢いか」から「どれなら十分か」へ
企業がAIを導入するとき、これまでの問いは「どのモデルが最も高性能か」でした。AT&Tが取っているのは、ほぼ逆の発想です。目の前の作業を確実にこなせる範囲で、最も安いモデルはどれか。この問いに機械的に答えるのが、モデルルーターと呼ばれる仕組みです。
AT&Tは、社員からのリクエストをLiteLLMなどのルーティング基盤でいったん受け止め、内容の難しさを判定してから振り分けています。過去に提出されたコードの要約や文書の要約といった負荷の軽い処理は、MetaのLlamaやGoogleのGemmaといったオープンモデルへ。複雑なコード生成のように失敗の代償が大きい処理は、AnthropicやOpenAIの最新モデルへ。同じ「AIを使う」でも、裏側では単価がまったく違うモデルが動いていることになります。
結果として、一部のコーディング作業では費用が56パーセント下がり、品質の落ち込みは2パーセントにとどまりました。この56と2という開きは、すべてをフロンティアモデルに投げる運用がいかに割高だったかを示す数字でもあります。
1日450億トークン、4割がオープンモデルへ
規模の話も具体的です。AT&Tの社内AI基盤は1日あたり450億トークンを処理しており、社員からのAIリクエストのおよそ40パーセントがオープンモデルに回されています。同社はこの比率を、今後60〜70パーセントまで引き上げる考えです。
同社で副社長を務めるMark Austin氏は、多くの業務においてオープンモデルは、AnthropicやOpenAIが以前提供していたモデルと同等かそれ以上だと述べています。ここで比較の相手が最新モデルではなく以前のモデルである点は、見落とすと話がずれます。オープンモデルが最先端に並んだという主張ではなく、1年前の最先端に相当する性能がオープンな重みで手に入るようになった、という主張です。そして社内業務の多くは、それで足りてしまいます。
狙いも明確で、AIの利用量そのものは増やしながら、プレミアムなAIサービスへの支出は横ばいに保ちたいとしています。
安いモデルが広がるとフロンティアが困る、とは限らない
この流れは、高価なモデルを売る側には逆風に見えます。ところが、Goldman Sachsで株式調査部門を率いるJim Covello氏は、別の可能性を指摘しています。
Covello氏の見立てでは、小型で安価なオープンモデルの進歩は、AmazonやMicrosoft、Googleといったハイパースケーラーにとって、むしろ追い風になります。オープンモデルによって企業がAIを採算に乗せやすくなれば、実行に値するAIアプリケーションの数が増える。アプリケーションが増えれば処理されるトークンが増え、その下で回るデータセンターへの需要も増える、という筋道です。同氏は、増設し続けている計算能力を採算の合う形で埋められる可能性が高まる点を、ハイパースケーラーにとっての利点として挙げています。
背景には、市場の空気の変化があります。かつては設備投資の増額を発表するたびに株価が報われる局面が続いていましたが、ここ1四半期ほどで市場はその前提を強く問い直すようになった、とCovello氏は言います。作れるかどうかではなく、作ったものを採算の取れる需要で埋められるかどうかが問われている、ということです。
同氏はまた、代償の大きい処理は高価なモデルへ、日常的な処理は安価なモデルへ振り分ける「モデル最適化レイヤー」を、企業AIにおける技術的なボトルネックとして挙げています。ここを解くことが、企業でAIの経済価値を引き出す鍵の1つになるという見方です。
まとめ
AT&Tの事例は、用途に応じたモデルの振り分けが机上の節約案ではなく、実運用に耐えることを示しました。一部のコーディング作業で費用は56パーセント減、品質低下は2パーセント。1日450億トークンのうち4割がすでにオープンモデル側へ流れ、目標は60〜70パーセントです。モデルを選ぶ基準が性能の順位から費用対効果へ移っていけば、企業のAI調達は単一ベンダーへの集約ではなく、複数モデルの併用へ傾いていくのかもしれません。
