Googleが音楽生成モデルのLyria 3.5を、Geminiアプリと Gemini API から使えるようにしました。7月末にGoogle Flow Musicで先に公開されていたモデルが、web版とモバイル版のGemini、そしてGoogle AI StudioやGoogle Vidsへと広がった形です。短いループを鳴らすのではなく、イントロからサビ、ブリッジまで構造を持った数分の曲を1回で書き上げるところが、これまでの音楽AIとの違いになります。

Geminiアプリ側は「ジャンルを選ぶ」から始められる

Geminiアプリでの操作は、作りたい曲のジャンルを一覧から選ぶか、言葉で説明するところから始まります。ボーカル入りかインストゥルメンタルかを決め、短いクリップにするか長めのトラックにするかを選ぶ、という流れです。何を書けばいいか迷う人向けにテンプレートも用意されました。

用途として想像しやすいのは、動画の背景に敷くBGM、店舗や個人ブランド用のジングル、自分だけの着信音あたりでしょう。作曲や編曲の知識がなくても、言葉で条件を並べれば形になるところが、この手のモデルがアプリ側に降りてくる意味だと思います。提供はwebとモバイルの両方で、Geminiの利用者全体に向けて展開されています。

30秒のクリップと、数分の楽曲でモデルが分かれる

開発者向けのGemini APIでは、用途に応じて2つのモデルを使い分ける構成になっています。

1つはLyria 3 Clip(モデルIDは lyria-3-clip-preview)で、こちらは常に30秒のクリップを返します。プロンプトを試行錯誤する段階や、ループ素材、プレビュー用途に向いた軽い方です。

もう1つが今回の主役であるLyria 3.5(モデルIDは lyria-3.5)で、Aメロ・サビ・ブリッジといった区別を理解したうえで数分のフル楽曲を組み立てます。長さはプロンプト側で「2分の曲を作って」のように指示するか、後述するタイムスタンプで構造を指定して調整します。

出力はどちらも44.1kHzのステレオ音声で、既定はMP3です。Lyria 3.5については、リクエストのレスポンス形式を切り替えることでWAVでも受け取れます。呼び出しには新しいInteractions APIを使い、生成された音声と一緒に歌詞や曲の構成もテキストとして返ってくる作りです。

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="lyria-3.5",
    input="A beautiful piano melody.",
)

歌詞もタイムラインも自分で書ける

Lyria 3.5で面白いのは、丸投げするだけでなく細かく指定できる余地が残されている点です。

自分で書いた歌詞をプロンプトに含めるときは、[Verse] [Chorus] [Bridge] といったセクションタグで区切ります。曲の進み方まで管理したい場合は、時間を指定する書き方が使えます。

[0:00 - 0:10] Intro: Begin with a soft lo-fi beat and muffled vinyl crackle.
[0:10 - 0:30] Verse 1: Add a warm Fender Rhodes piano melody and gentle vocals.
[0:30 - 0:50] Chorus: Full band with upbeat drums and soaring synth leads.
[0:50 - 1:00] Outro: Fade out with the piano melody alone.

入力はテキストだけではありません。Lyria 3.5はマルチモーダル入力に対応していて、画像を最大10枚までテキストと一緒に渡せます。写真の雰囲気や色から曲を起こす、という使い方ができるわけです。

歌詞の言語はプロンプトの言語に従います。フランス語で指示すればフランス語の歌詞になり、発音や歌い回しもその言語に寄せられます。日本語で書けば日本語の歌詞が返ってくる理屈です。

なお、モデルは音を出す前に曲の構造を内部で組み立てる仕組みを持っています。ただしその中間の思考内容は利用者側には公開されません。

料金は1曲0.08ドル、無料枠は無い

Gemini API経由での価格は明快で、Lyria 3.5のフル楽曲が1曲あたり0.08ドル(約12円)です。30秒のLyria 3 Clipは1曲あたり0.04ドル(約6円)となっています。どちらも無料枠は用意されておらず、有料ティアのみでの提供です。

※1ドル156円換算

制約もいくつか明記されています。プロンプトはすべてセーフティフィルタを通り、特定のアーティストの声を求めるものや、著作権のある歌詞を生成させようとするものは弾かれます。生成された音声には例外なくSynthIDによる電子透かしが入りますが、これは人間の耳には聞こえず、聴感には影響しません。

また、音楽生成は1回きりの処理です。出来上がった曲を対話しながら少しずつ直していく、といったマルチターンの編集は現時点では想定されていません。同じプロンプトでも呼び出すたびに結果が変わる点も、仕様として明示されています。気に入った1曲を狙って出すというより、条件を詰めて何度か回す前提の道具と考えたほうが良さそうです。

まとめ

Lyria 3.5がGeminiアプリとAPIに載ったことで、30秒のループ素材を作る段階から、構成を持った数分の曲を出す段階へと音楽生成AIの標準的な出力が変わりました。アプリ側はジャンルとボーカルの有無を選ぶだけ、API側はセクションタグやタイムスタンプで細かく詰められる、という二段構えです。1曲0.08ドルという価格と、SynthIDの透かし、マルチターン編集への非対応まで含めて、どこまで実用に耐えるかは実際に触ってみてからの判断になりそうです。