🎨 雑なプロンプト一発勝負!Gemini3.0 vs 2.5 の生成能力差を検証

に公開

導入

Gemini 3.0が登場しましたね。gemini3.0の登場に伴いcanvasの性能も上がりました。
私が面白いなと思ったのは空気を読むと言われているということです。
そこでgeminiに曖昧なプロンプトで指示を出すとモデル間でどれくらい差が出るのかを検証しました。
現在高速モードと思考モードの二つ用意されています。
モデルの確認方法は以下の通りです。
出力の一番下の縦三点リーダーで確認できます


1. 検証プロンプトと設定

項目 詳細
検証プロンプト 「ブロックの世界のねこ・犬・きつねの3Dのモデル」
検証モデル Gemini 2.5世代のモデル、および Gemini 3.0世代の最新モデル
検証目的 曖昧なプロンプトに対し、「3D」「ブロック(ボクセル)」「動物の区別」「一貫したスタイル」を正確に行えるか。

2. Gemini 2.5世代のモデルによる出力結果

謎の物体ができましたね

🔹 【結果】要素は認識するが、統一感が無い

以下は、Gemini 2.5世代のモデルに同じプロンプトを投げた際の出力例です。
ねこ

キツネ

  • スタイルの不統一: 色合いやブロックの配置がバラバラで、同じプロンプトから生成されたとは思えないほど、スタイルに一貫性がありません。
  • 不自然な形状: ブロックが空中に浮いている

3. Gemini 3.0世代のモデルによる劇的な進化:【文脈の理解】

Gemini 3.0世代の最新モデルは、プロンプトに含まれる 「集合・配置」 という隠れた文脈と、「ボクセルアート」 というスタイルを正確に理解し、再現しました。

🔸 【結果】意図を汲み取り、一貫したシーンを生成

Gemini 3.0世代の出力例: 3匹の動物が一貫して並んでいる

Gemini 3.0世代のモデルは、以下の点で劇的な進化が見られました。

  • 動物の特徴の忠実な再現: ねこ、犬、きつねの 個々の特徴(耳の形、配色) を、すべて同じボクセルスタイルの中で忠実に描き分けています。
  • スタイルの統一: 全体が均質な ボクセルアート としてレンダリングされており、画風のバラつきがなく、完成度が高いアセットの集合体となっています。

まとめ:AIは「文脈と意図」を理解するステージへ

この比較検証から、Gemini 3.0世代のAIが、単なるキーワードの処理から、 「ユーザーが何を表現したいのか」という視覚的・文脈的な意図を推論 するステージに入ったことがわかります。

雑なプロンプトでも、ここまでのものを作成してしまうのでこれからは、どう作るかではなく 何を作るのかという考え・アイデアが大切になっていくと思いました。

Discussion