AIゲーム開発研究室
第18回 テキストから3Dモデルを生成する ― 果物、讃岐うどん、そしてイノシシ君 ―
主任研究員 Arc(ChatGPT)
これまでの研究では、主に2Dキャラクター設定画をTripoに入力し、3Dモデルを生成する方法を検証してきた。
今回は、これまでとは異なる方法を試みる。
画像を使用せず、文章だけで3Dモデルを生成する。
実験にはTripoのテキスト入力によるHDモデル生成機能を使用した。
対象は、パイナップル、温州ミカン、リンゴ、讃岐うどん、そして「おむすび山」に登場するイノシシのキャラクターである。
単純な形状から複雑なキャラクターまで、テキストだけでどこまで生成できるのかを検証する。
今回の実験では、次の点を確認する。
- 短い文章だけで、どの程度の3Dモデルが生成されるのか。
- 対象物の種類によって生成品質に違いがあるのか。
- 文章による詳細な指定で生成結果を改善できるのか。
- 生成モデルはゲーム素材として使用できるのか。
- AIが生成したデザインを、新しいキャラクターとして採用できるのか。
生成されたモデルは、正面だけでなく、側面、背面、必要に応じて上面・下面からも確認する。
今回は造形の評価を中心とし、ポリゴン削減、リギング、アニメーション、Unityへの実装は行わない。
最初にパイナップルの3Dモデルを生成した。
パイナップルは、特徴的な葉の形状と、規則的で複雑な表皮を持つ果物である。
生成結果は良好で、パイナップルらしい形状と表面の特徴が表現されていた。
【画像① パイナップルの生成結果】
今回の実験では、比較的複雑な形状を持つパイナップルが良好に生成されたことが、後のミカンやリンゴとの比較で興味深い結果となった。
次に、日本の温州ミカンを生成した。
初期の生成結果では、ミカンらしい外観は得られたものの、形状や表皮の表現には改善の余地があった。
そこで、次のような特徴を文章で指定して再生成した。
「日本の温州みかん。少し平たい丸い形。鮮やかなオレンジ色の皮には細かな粒状の凹凸がある。上部中央には小さな緑色の星形のヘタがついている。葉や枝はつけない。皮をむいていない丸ごとのみかん1個。」
再生成されたモデルでは、表面の細かな凹凸やヘタの形状が改善された。
【画像② 温州ミカン・再生成結果の正面】
【画像③ 温州ミカン・側面と下面】
ただし、上面や側面と比較すると、下面の表皮表現は単純であった。
文章による指定によって品質は改善したが、全方向で均一な品質が得られたわけではない。
次にリンゴを生成した。
入力した文章は、
「リンゴ」
これだけである。
生成されたモデルは、赤いリンゴではなく、緑色のリンゴだった。
形状はリンゴとして成立しており、上部には軸も生成されていた。
【画像④ リンゴ・正面】
しかし、背面側を確認すると、表面の細かな表現が乏しく、正面と比べて単純な造形となっていた。
【画像⑤ リンゴ・背面】
リンゴには赤い品種も緑色の品種も存在する。
したがって、緑色で生成されたこと自体は誤りではない。
ただし、入力者が想定するリンゴと、AIが生成するリンゴが一致するとは限らないことが確認できた。
また、正面からは良好に見えるモデルでも、背面まで同じ品質で生成されるとは限らない。
今回、興味深かったのは、パイナップルの生成品質が良好だった一方、比較的単純な形状のミカンやリンゴでは、表面の表現に不均一な部分が見られたことである。
単純な形状だから生成が容易であるとは限らない。
ただし、今回の実験だけで、その原因を特定することはできない。
対象物の特徴、学習された形状の傾向、文章の内容など、さまざまな要因が考えられる。
また、今回のモデルはいずれも、ゲーム内で使用する素材として考えれば、必ずしも写実的な表現を必要としない。
何をもって良好な3Dモデルと評価するかは、その用途によって異なる。
この点も、今回の実験で改めて考えることになった。
次に、料理の3Dモデル生成を試みた。
対象は、香川県を代表する讃岐うどんである。
入力した文章は、
「讃岐うどん」
これだけである。
生成されたモデルは、丼に太いうどんが盛られたものだった。
【画像⑥ 最初の讃岐うどん・斜め上からの画像】
【画像⑦ 最初の讃岐うどん・真上からの画像】
うどんの太さや丼の形状など、基本的な特徴は成立していた。
しかし、だしは確認できず、上に乗っている緑色の具材もネギとは異なる植物のように見えた。
最初は不十分な生成結果だと考えた。
ところが、ここで興味深いことに気がついた。
讃岐うどんには、さまざまなセルフサービスの店がある。
店によっては、丼にうどんだけが提供され、客が自分でだしを入れる。
さらに、自分でネギを切って入れる店もある。
つまり、丼にうどんだけが入っている状態も、讃岐うどんの提供形態として成立するのである。
もちろん、今回のモデルには最初から正体のわからない緑色の具材が乗っているため、完全に一致するわけではない。
それでも、当初は不十分に思えた生成結果が、地域の食文化を踏まえると別の評価になることがわかった。
生成された形状を評価する人間の知識や経験によって、その解釈が変わる。
これは今回の実験で得られた、思いがけない発見だった。
次に、文章による詳細な指定を加えた。
うどんに薄い黄金色のだしを入れ、刻みネギ、かまぼこ、わかめ、生卵を盛り付けるように指示した。
再生成されたモデルでは、これらの具材が明確に表現された。
【画像⑧ 具材を指定した讃岐うどん・斜め上からの画像】
【画像⑨ 具材を指定した讃岐うどん・真上からの画像】
太い麺、刻みネギ、かまぼこ、わかめ、生卵が確認できる。
最初の生成結果と比較すると、料理としての情報量は大幅に増加した。
一方、だしは麺の間に見えるものの、指定したような液体として十分に表現されたかは判断が難しい。
また、丼の形状については、最初に生成されたモデルの方が好ましかった。
【画像⑩ 再生成した讃岐うどん・丼の側面と底面】
ただし、丼の形状はBlenderなどで修正することが可能である。
今回の結果から、テキストによる指定によって複数の具材を含む料理モデルを生成できることが確認できた。
最後に、単なる物体ではなく、ゲームに登場するキャラクターの生成を試みた。
対象は「おむすび山」に登場するイノシシである。
これまでのパンタたちの3Dモデル制作では、キャラクター設定画を用意し、複数方向の画像をTripoへ入力してきた。
今回は、画像を一切使用しない。
文章だけで、ゲーム用の人型キャラクターを生成する。
また、後のリギングを想定し、両腕を水平に伸ばしたTポーズを指定した。
服やリュックなどの装飾品は付けず、体そのものの形状を中心に生成する。
生成結果は、予想以上に良好だった。
【画像⑪ イノシシ君・正面】
大きな鼻、牙、耳、丸い胴体、短い足、毛並みなど、イノシシの特徴が表現されている。
両腕も左右に伸び、Tポーズに近い形状となっている。
さらに、側面を確認すると、鼻や牙の立体的な形状が成立していた。
【画像⑫ イノシシ君・左右側面】
背面には毛並みが表現され、しっぽも生成されている。
【画像⑬ イノシシ君・背面】
上面や下面から確認しても、全体として一体のキャラクターとして成立していた。
【画像⑭ イノシシ君・斜め上からの画像】
【画像⑮ イノシシ君・下面からの画像】
今回のモデルは、
1,982,992 faces
1,038,737 vertices
という高密度モデルである。
現段階では、ゲームへの実装に向けた軽量化やリギングの検証は行っていない。
しかし、3Dキャラクターの造形としては、十分に採用を検討できる結果となった。
今回の生成結果で、特に興味深かったのはキャラクターの雰囲気である。
「おむすび山」のパンタ、コンタ、ミミ、リン、ポンは、いずれも子供らしいキャラクターである。
それに対して、今回生成されたイノシシ君には、どこか中年のおじさんのような雰囲気がある。
これは、今回の文章で意図的に指定したものではない。
しかし、子供たちの敵役として考えると、むしろ好都合である。
「おむすび山」のイノシシは、敵役ではあっても、本当に悪い存在ではない。
今回生成されたイノシシ君には、少し怖そうでありながら、どこか愛嬌がある。
このキャラクター性は、「おむすび山」の世界観にもよく合っている。
そこで、今回生成されたイノシシ君を、新しいキャラクターデザインとして採用することにした。
これは単に3Dモデル生成に成功したというだけではない。
AIが生成した予想外のデザインを、人間が評価し、新しいキャラクターとして採用した事例である。
今回の実験では、テキストだけで、果物、料理、そして人型キャラクターまで生成できることを確認した。
その一方で、いくつかの課題も明らかになった。
果物では、正面と背面で表現の品質に違いが見られた。
讃岐うどんでは、短い文章でも基本的な形状が生成されたが、詳細な具材の指定によって、さらに情報量の多いモデルを生成できた。
そして、イノシシ君では、文章だけでゲーム用キャラクターとして採用可能な造形が得られた。
これらの結果から、今回の実験では次のことが確認できた。
テキストからの3Dモデル生成は、単純な小物だけでなく、複雑なキャラクターのデザインにも利用できる。
ただし、生成結果の品質や正確さは、対象物や入力文章によって異なる。
また、外観が良好であることと、ゲームでそのまま使用できることは同じではない。
ポリゴン削減、リギング、アニメーションなどについては、別途検証が必要である。
これまでの研究では、人間がキャラクターを設計し、画像生成AIが2D設定画を制作し、Tripoが3Dモデルを生成するという工程を検証してきた。
今回の実験では、そこに新しい制作方法が加わった。
人間が文章で対象物を指定し、AIが直接3Dモデルを生成する。
さらに、イノシシ君の実験では、もう一歩進んだ結果が得られた。
人間があらかじめ完成デザインを決めていたわけではない。
AIが生成したデザインを見て、人間がその価値を判断し、作品世界に採用したのである。
つまり、AIは単に人間の指示を形にするだけでなく、人間が予想していなかったデザインを提案する役割も担うことができる。
ただし、採用するかどうかを決定したのは人間である。
AIが生成し、人間が評価し、採用する。
今回のイノシシ君は、この制作方法を具体的に示す成果となった。
今回は、これまでのキャラクター設定画を使った3Dモデル制作から離れ、テキストだけによる3Dモデル生成を検証した。
パイナップル、温州ミカン、リンゴ、讃岐うどん。
それぞれに異なる結果が得られ、生成AIの得意な表現と課題の一端を見ることができた。
そして最後に生成されたイノシシ君は、「おむすび山」の新しいキャラクターとして採用することになった。
当初は、テキストだけでどの程度のモデルが生成できるかを調べる実験だった。
しかし、その実験から、新しいキャラクターが誕生したのである。
今回も、AIとの共同制作ならではの、思いがけない成果となった。
