PixAI最新モデル「Tsubaki.3」の技術レポートから読み解く、画像生成の“ガチャ”問題を克服する画期的アプローチ
AI二次元創作プラットフォーム「PixAI」が9月16日、自社開発の最新モデル「Tsubaki.3」を正式リリースした。
Tsubaki.3は、イラスト・マンガ制作・動画生成までが行える「アニメ調オールインワンAI創作モデル」だ。「描く→物語にする→動かす」をひとつのモデルでつくり上げることをコンセプトに、イラストを生成するだけではなく、キャラクター設定や線画、マンガページ、動画までを同じキャラクター・画風の理解のもとで展開し、創作の「結果」だけでなく「過程」にも入り込めることを目指している。また、主な特徴としては、1枚の参考画像から表情や角度、衣装を変えた同じキャラクターを展開しやすいことや、線画から完成までの制作工程を段階的に生成・編集できること、さらにマンガページや動画まで生成できることが挙げられる。
AIで画像や動画を生成したことがある人なら、狙いどおりの成果物が出てくるまでに、指示を出し直したり生成をやり直したりしながら仕上げていく、いわゆる“ガチャを回す”作業に覚えがあるだろう。
Tsubaki.3の数ある特徴の中で注目したいのは、この“ガチャ”を起こりにくくするための工夫だ。PixAIがTsubaki.3とともに公開した技術レポートを読むと、画像の生成と編集を中心に、データや学習の段階からそうした工夫が重ねられていることが読み取れる。本稿では、このレポートを読み解いたうえで、Tsubaki.3を実際に使ってその実力を確かめていく。
なお、「Tsubaki.3」の特設ページでは、ポーズや表情、衣装の変更、バリエーションの生成、着色といった作例がプロンプトと共に公開されている。開発チームによるデモだけでなく、実際にPixAIユーザーが生成した作品もあるので、資料として参考にしてみてほしい。
写真風の画像と異なる、AIイラスト特有の課題とは
技術レポートは冒頭で、現行の画像生成AIは写真のような画像であれば、「高い解像度で、形も崩れず、文字もきれいに、指示どおりに描けるようになった」と述べたうえで、アニメイラストでは「課題の性質が異なる」と指摘している。その理由として挙げられているのが、「概念の密度の高さ」と「ロングテール」の問題だ。
アニメイラストでは、ひとつの指示の中に画風の名前や、見た目も動作も違う複数のキャラクター、難しいポーズ、凝ったカメラアングルが一度に並ぶことがある。しかもユーザーが本当に求める表現は、生成AIが得意とする“平均値”ではなく、学習データにめったに出てこない珍しい概念の側、つまり裾野(ロングテール)にあるという。
指定したいことが多いうえに、その多くが珍しい。であれば、アニメの絵が一度で狙いどおりに仕上がりにくいのも無理はない。そこで、生成した結果を見て「ポーズだけ変えたい」「背景だけ差し替えたい」「看板の文字だけ直したい」と一部に手を入れても、キャラクターの顔立ちや衣装の飾りまで変わってしまい、結局また“ガチャを回す”ことになりがちだ。
こうした課題に対してTsubaki.3がとったアプローチのひとつが、あらかじめ「どこを変え、どこを保つか」を決めておくことだ。レポートによると、画像の一部を直す編集では、保つべきものを「指定された編集領域以外のすべて」と定めている。例として挙げられた13種類の編集にはキャラクターの動作の編集や背景の置き換え、文字の置き換えも含まれており、先に触れた「ポーズだけ」「背景だけ」「文字だけ」を直したい場面にそのまま当てはまる。
この考え方は、学習に使うデータの選び方にも表れている。同じキャラクターのはずのふたつのコマで衣装が変わっていないか、1カ所だけを変えたはずの画像に別の変更が混ざっていないかを、審査役の専用AIが画像の組ごとに確かめ、条件に合わないものは学習に使わない。レポートによれば、検証を通過する組は、集めた組よりはるかに少ないそうだ。
また、短い指示をモデルが読み慣れた詳しい書き方に直す「プロンプト自動変換(Prompt Helper)」という仕組みにも、同じ考え方が見て取れる。これは、ユーザーが書いた内容はそのまま残し、カメラや光のように決まっていない部分だけを補うというものだ。
では、指示を重ねて少しずつ直していけば、いずれは狙いどおりの一枚にたどり着けるのだろうか。その手がかりになるのが、最近Xで物議を醸した“AIキモ飯”だ。
「修正指示の回数」と「生成物のクオリティ」は負の相関関係にある
“AIキモ飯”とは、画像生成AIで作られたとみられる、現実離れした見た目の料理の画像のことをいう。こうした見た目の崩れは、修正を重ねることで起こる場合もある。あるYouTuberが、飲食店のPOP風の画像の中にある料理自体にはなるべく手を付けず、文字だけを直すよう繰り返し指示したところ、18回ほどで料理の見た目が崩れ、AIキモ飯化したのだ。この検証から「修正指示の回数」と「生成物のクオリティ」が負の相関関係になりやすいことがうかがえる。そしてこの関係は、画像生成AIモデルを作る段階でも大きな課題になっている。
Tsubaki.3の技術レポートが、この分野の仕上げの学習(ポストトレーニング)で最も重要な課題に挙げているのが、画風の崩壊だ。といっても、これは絵が壊れるわけではなく、正確さを高める学習を行うと、モデルの出力が平凡で平均的なひとつの画風へと急速に寄っていってしまう現象を指す。その原因は、正確さを採点するAIが平凡で硬い画像を高く評価しがちな点にあるという。多彩な画風こそが持ち味のアニメのモデルにとって、見過ごせない問題だ。
そこでTsubaki.3は、仕上げの学習を3つの段階に分けて進めている。最初の段階では、画風を見極める訓練を受けたスタッフが選んだ約7,000枚の絵を、お手本として学習させた。これで絵の美しさは上がったものの、手や人体の破綻が起きやすくなった。そのため次の段階では、人体構造や文字描画など4つの分野を対象に正確さを高め、形の崩れた手や余分な腕、ねじれたテーブルの脚といった破綻を直した。
ただ、正確さを追うと絵はやや硬い印象になるため、最後の段階として、絵としての美しさを取り戻す、いわば修正指示を出した後のクオリティを補完する学習を組み込んだ。そして、採点役には、人間の好みのデータで鍛えたAIに加え、フラットな塗りならシルエットと配色、絵画調なら筆致というように、絵の種類ごとに基準を持ち替えるAIの審査員を置いた。
美しさを高めると、今度は指示への追従性が下がっていく。このためTsubaki.3は、学習途中のモデルをいくつも評価し、正確さと美しさのバランスが最もよい地点を選んで製品版としてリリースしている。こうした仕上げの学習は、テキストから画像を生成する系統で行われている。指示への正確さと絵としての魅力の両方をモデルの段階であらかじめ整えておくことは、“ガチャ”を回す回数を減らすための土台づくりともいえるだろう。
一方、画像の一部を直す編集は、先述した、保つべきものの定義に支えられている。AIキモ飯の例のように、直してほしくない部分まで描き直されてしまう事態を避けるための設計といえる。
技術レポートは、アニメの絵の難しさとしてもうひとつ、アニメの概念の多くには普通の言葉での説明がなく、コミュニティ特有のタグの体系で呼ばれている点を挙げている。こうした特殊さに向き合うため、Tsubaki.3はAIの“脳”にあたる生成モデルを鍛える前の段階で、学習データを見極める“目”を鍛えている。
レポートによると、汎用の画像理解モデルでアニメ画像をグループ分けしてみたところ、ほぼ描かれている対象や構図だけでまとめてしまい、画風がまったく違う絵が同じグループに入ることも珍しくなかったという。そこで、この汎用モデルをアニメのデータで鍛え直し、画風や配色、キャラクターの違い、場面の構造まで見分けられるようにしたのが「SigLip-Anime」だ。これを土台に、透かし入りの画像や広告のような画像を取り除く品質フィルタリングなどの工程を重ね、約5億件あった画像・テキストペアを約5000万件まで絞り込んでいる。
もうひとつの“目”にあたるのが、アニメ画像に3万種類あまりのタグを付けるタグ付けモデル「Tagger 1.0」だ。学習用の画像の説明書きを付け直したり、同じキャラクターが描かれた画像を集めて学習用の組を作ったりする、いわば”索引係”の役割を担っており、オープンソースとして公開もされている。
どちらもユーザーが直接操作する道具ではないが、学習データの精度を高めることで、キャラクター名などアニメの細かな指定に応える力を下支えしているといえるだろう。
実際に「Tsubaki.3」を使ってみる
ここまで見てきたように、Tsubaki.3の技術レポートからは、学習データを見極める“目”づくりから、編集で保つべきものの定義、正確さと美しさのバランスを取った仕上げまで、アニメの絵を思いどおりに描くための工夫が開発の各段階に組み込まれていることが見えてくる。
ここからは、PixAI上でTsubaki.3を実際に使ってみる。まずは基準となるキャラクターを作った。その際のプロンプトは「銀髪のショートボブの女の子。赤い目。黒いゴシック調のワンピースで、胸元に青いリボン。左耳に星形のイヤリング、腰に金色の懐中時計。」とした。外見の特徴を並べただけの短い指示だが、髪型から小物まで、書いた特徴はすべて描き込まれた。
次は、このキャラクターのポーズだけを変えてみた。技術レポートの分類でいえば、画像の一部を直す編集ではなく、参照画像をもとに新しく描き直す「参照生成」にあたる指示だ。レポートによると、参照生成では、新しい画像に持ち込むのは「参照画像が提供するもの」だけだと定めている。PixAIの「スマート参照」で基準のキャラクターを読み込み、キャラクターの特徴はそのままに、ひざまずくポーズを取るよう指示した。その結果、ポーズは狙いどおりに変わり、キャラクターの特徴も保たれていた。
続いて、画像の一部だけを直す編集を3回重ねてみた。1回目は背景だけを夕暮れの図書館に変え、キャラクターに当たる光も窓から差し込む夕日に合わせた。2回目は手に赤い表紙の本を持たせ、3回目はその表紙に金色の文字で「魔法の図書館」と入れた。
背景と光、本、表紙の文字は、いずれも指示どおりに反映され、前の回で変えた背景も次の回へ引き継がれた。今回試した3回の修正では、キャラクターの顔立ちなどの特徴も含め、変更した部分以外が崩れることはなかった。
意図せぬ生成結果の修正にも対応 狙い通りの一枚が簡単に作れる
実は、ここまでの画像には、指示していない要素がひとつ紛れ込んでいた。ポーズを変えた段階で、手に見慣れない透明な小物が加わっていたのだ。背景や本、文字を直しているあいだは気づかず、記事を書くために画像を見返して初めて気がついた。そこで、生成済みの画像を文章の指示で直せる「テキストで編集」の機能を使い、ポーズを変えた画像からこの小物だけを消せるか試してみた。
最初は「手に持っている透明な小物を消してください」に続けて、キャラクターの特徴やポーズ、背景はそのままにするよう書いた。すると小物は消えたが、指を伸ばして何かをつまむような手の形が、拳に近い別の形に変わってしまった。ポーズを保つよう書いてはいたものの、指の形までは伝わらなかったようだ。
2回目は、「手の形とポーズはそのまま、指の爪が見えている状態を保ってください」という一文を書き添えた。今度は小物が消え、指を伸ばして爪が見える手の形も保たれた。残したい部分は、具体的に書くほど結果が安定しやすいと感じた。
今回の検証を通じて、技術レポートから読み取れた「どこを変え、どこを保つか」という考え方は、実際の生成や編集の結果にも表れていると実感した。試した範囲では、背景や本、文字を続けて直しても絵が崩れることはなく、狙いどおりの一枚を求めて何度も生成し直す“ガチャを回す”状態にはなりにくかった。そのため、生成結果に対する不満やストレスを感じることは少なかった。
PixAIの制作ツール「PixAI Studio」でさらに広がるバリエーション
最後に、PixAIに用意されている制作ツール「PixAI Studio」も試してみた。PixAI Studioは、画像生成や動画生成、編集、素材管理といった機能を、ひとつのキャンバス上で自由に組み合わせられる統合型AI創作ツールだ。ここでは、先ほど作ったキャラクターの画像の動画化に挑戦した。
キャンバスに本を持つキャラクターの画像を置いて動画生成の機能とつなぎ、本から顔を上げて微笑む動きと、窓からの風で揺れる髪やリボン、顔に寄っていくカメラワークを指示した。モデルは「Tsubaki Video」を選び、720P、5秒で生成している。できあがった動画では、キャラクターが顔立ちや銀髪、ワンピース、懐中時計といった特徴を保ったまま、指示どおりに動いた。窓からの風という言葉に反応したのか、指定していない風の音まで自然に入っていたのには驚いた。
ちなみにPixAI Studioには用途に合わせたテンプレートも用意されており、同じキャラクターをもとに、設定資料やマンガページの生成、さらにそのマンガの動画化といったことも行える。
- テンプレートで作ったキャラクターの設定資料。衣装のパーツや表情違い、持ち物までがまとめられている
- テンプレート「PixAI Edit Pro」で作った、雨の夜の路地を舞台にした6コマのマンガページ
このようにPixAI Studioでは、1枚のキャラクター画像から、設定資料やマンガ、動画へと、同じキャラクターのまま展開していける。その用途の広さと、機能をつないでいくだけのシンプルな操作性に魅力を感じた。
何でも描ける汎用のAIが広がるなかで、Tsubaki.3は、写真とは違うアニメならではの難しさを出発点に、データの選別から学習、評価に至るまで、アニメのために組み立てられている。こうした課題の解決に向けた仕組みを備えている点で、アニメ調のAI生成画像を作りたい人にとって、創作の心強い味方になるはずだ。
■PixAI 4周年キャンペーン
期間:2026年9月17日(木)〜10月20日(火)
・アニメ調オールインワンAI創作モデル「Tsubaki.3」リリース
・「Tsubaki.3」無料使用カードをログインでゲット
・プレミアム会員プランで「Tsubaki.3」無限使用モードを4周年イベント期間限定販売
・年間プラン50%OFF ほか
▼4周年イベントページ
https://pixai.art/ja/event/4th-anniversary
【音楽番組『PixAI Music Jam』】
出演:AIYUE blessed : 理名/榊原ゆい/片霧烈火/結城アイラ/yozuca*
MC:青木佑磨
YouTubeにて期間限定公開中
https://www.youtube.com/watch?v=MmU8Pp_ZLvA
【4周年記念MV『UnLocking World』】
歌:AIYUE blessed : 理名(「トゲナシトゲアリ」ボーカル)
https://www.youtube.com/watch?v=QTJeczW-SSA
【PixAIについて】
2022年10月のサービス開始以来、世界160以上の国と地域、1,600万人以上のクリエイターに利用されているAI二次元創作プラットフォーム。
公式サイト
■関連リンク
PixAI公式サイト
対話型創作エージェント「Mio.2」
Tsubaki.3特設ページ
「Tsubaki.3 技術レポート」
PixAI公式ブログ(Tsubaki.3の使い方を大公開など)
公式YouTubeチャンネル