ローカルで大規模言語モデル(LLM)を動かすツール「Ollama」が、テキストから画像を生成する機能に実験的に対応しました[1]。まずmacOS向けに提供され、WindowsとLinuxへの対応も近く予定されています[1]。AlibabaのTongyi Labが開発した「Z-Image Turbo」と、Black Forest Labsの「FLUX.2 Klein」という2つのモデルを、手元のマシンだけで動かせる点が特徴です[1]。クラウドのサービスに頼らず、画像生成までローカルで完結させたい人にとって選択肢が広がりました。
Mac でまず使える、ターミナル完結の画像生成
Ollamaの画像生成は、これまでのチャット用モデルと同じように、ターミナルからコマンド1つで呼び出せます[1]。使い方はモデル名にプロンプト(指示文)を添えて実行するだけです[1]。
ollama run x/z-image-turbo "your prompt"
生成された画像は、現在作業しているディレクトリ(フォルダ)に保存されます[1]。さらに、画像表示に対応したターミナルであれば、保存した画像をその場でプレビュー表示できます。具体的にはGhosttyやiTerm2といったターミナルが対象として挙げられています[1]。生成から確認までを1つの画面で済ませられるため、別途ビューアーを開く手間がありません。
現時点での対応OSはmacOSのみで、WindowsとLinuxは「近日対応」とされています[1]。手元のMacで完結するため、入力したプロンプトや生成画像を外部のサーバーへ送らずに済む点は、プライバシーや通信環境を気にする場面で利点になります。
同梱モデル「Z-Image Turbo」と「FLUX.2 Klein」
今回の実験対応では、2つの画像生成モデルが用意されています[1]。
1つ目は「Z-Image Turbo」です。AlibabaのTongyi Labが手がけた60億パラメータ(モデルの規模を示す数値)のテキスト画像変換モデルで、写実的な画像の生成を得意とします[1]。英語と中国語の双方について、画像内に文字を正確に描き込める点も特徴に挙げられています[1]。ライセンスはApache 2.0で、重み(学習済みデータ)が公開されており、商用利用も認められています[1]。実行コマンドは次の通りです[1]。
ollama run x/z-image-turbo
2つ目は「FLUX.2 Klein」です。Black Forest Labsが提供する同社で最速の画像生成モデルと位置づけられ、40億(4B)と90億(9B)の2つのパラメータ規模が用意されています[1]。画像内の読みやすい文字描写に強く、UIのモックアップ(試作の画面イメージ)や文字を使ったデザインに向くとされています[1]。ライセンスは規模ごとに異なり、4Bモデルは商用利用も可能なApache 2.0、9Bモデルは「FLUX Non-Commercial License v2.1」という非商用ライセンスが適用されます[1]。実行コマンドは次の通りです[1]。
ollama run x/flux2-klein
両モデルとも、用途に応じて使い分けられる構成です。写実的な写真風の表現を重視するならZ-Image Turbo、文字を含むデザイン用途ならFLUX.2 Klein、といった選び方が想定されます。
生成を細かく調整する設定項目
Ollamaの画像生成では、いくつかのパラメータを指定して結果を調整できます[1]。
保存先は現在のディレクトリが既定ですが、ターミナルで移動先のディレクトリを変えれば保存場所も変更できます[1]。画像サイズは「/set width」「/set height」コマンドで横幅と高さを指定でき、小さい画像ほど生成が速く、消費メモリも抑えられます[1]。
生成の品質と速度を左右するのがステップ数です[1]。モデルが内部で繰り返す処理の回数を指す値で、少なければ速いものの細部が粗くなり、逆に多すぎると不要なノイズ(アーティファクト)が出ることもあります[1]。Ollamaは各モデルに推奨される既定値をあらかじめ設定しています[1]。
このほか、同じ結果を再現したいときに使うシード値(乱数の種)や、画像に含めたくない要素を指示するネガティブプロンプトも指定できます[1]。シード値を固定すれば、同じプロンプトから同じ画像を再び得られるため、構図を少しずつ詰めたり、生成結果を共有したりする際に役立ちます[1]。
今後の展開
Ollamaは今後の予定として、WindowsとLinuxへの対応に加え、画像生成モデルの追加と画像編集機能への対応を挙げています[1]。現状はあくまで実験的な位置づけですが、ローカルでチャットからコード生成までこなしてきたOllamaに画像生成が加わることで、手元のマシン1台で扱えるAIの用途がさらに広がりそうです。
まとめ
Ollamaがテキストからの画像生成に実験的に対応し、まずmacOSで利用できるようになりました。AlibabaのTongyi Labによる写実表現に強い「Z-Image Turbo」と、Black Forest Labsの文字描写に強い「FLUX.2 Klein」の2モデルを同梱し、いずれもターミナルのコマンド1つで実行できます。保存先やサイズ、ステップ数、シード値、ネガティブプロンプトといった調整項目もそろい、クラウドに送らずローカルだけで画像生成を試せる環境が整いました。WindowsとLinuxへの対応や画像編集機能の追加も予告されており、今後の拡張が注目されます。
