12分で読めます

ロボットビジョン学習データのための AI テクスチャ生成: ドメインランダム化の実践ガイド

要約

ロボットビジョン AI モデルは、表面の見た目に左右されずに物体を認識できるよう、ドメインランダム化という手法で訓練されます。同じ 3D モデルを木材、金属、銅、プラスチック、塗装仕上げなど異なるマテリアルで何百回もレンダリングし、モデルが固定された見た目ではなく形状や機能を学ぶようにする方法です。これまでのボトルネックは、専任の 3D アートチームなしで、フル PBR 品質 (Albedo、Normal、Roughness、Metallic、AO) のマテリアルバリエーションを十分な速度で作ることでした。TextureFast は、UV 展開済みの 3D モデルに対して、テキスト説明または参照画像から約 30〜120 秒で 4K の PBR マテリアルセットを生成します。これにより、合成学習データ向けの実用的なテクスチャランダム化プールを、スタジオではなく 1〜2 人の ML チームでも構築しやすくなります。

ドメインランダム化とは何か、そしてなぜテクスチャが特に効くパラメータなのか

ドメインランダム化は、シミュレーションだけで訓練したビジョンモデルが、実際のカメラ、実際の照明、実際の物体表面に出会ったときに性能低下する「sim-to-real ギャップ」を埋めるための標準的な手法です。NVIDIA の元論文では、照明、姿勢、物体テクスチャなどのシミュレーターパラメータをランダム化することで、モデルが特定のレンダリングを暗記するのではなく、タスクに本質的な特徴を学ぶと説明されています。NVIDIA Isaac Sim Replicator ドキュメントでも、合成データ生成のワークフローで同じ考え方が示されています。

この中で、テクスチャは小さな要素ではありません。ドメインランダム化を実物体検出へ拡張した NVIDIA の CVPR 論文 (Tremblay et al., 2018) では、対象物体のランダム化テクスチャを取り除くと、論文内のアブレーション実験で検出精度が測定可能に低下しました。テクスチャランダム化は、照明と並んでパイプライン全体の中でも重要なレバーの一つでした。

この傾向は、より新しいロボティクス研究にも繰り返し現れています。

つまり、物体検出器や把持姿勢推定器が、ある物体の一つの仕上げしか見たことがないなら、それはまだ物体そのものを学んだとは言えません。写真を覚えただけです。

  • RoboTwin 2.0 (2025) は双腕マニピュレーションのベンチマークで、LLM プロンプトと Web クロールで集めた 1,000 件の表面説明から 20,000 枚の AI 画像を生成し、人手で約 11,000 枚の背景テクスチャに絞り込みました。これは、学習に十分なマテリアル多様性を入れるためです。
  • SHOP-VRB2 は家庭内物体操作のベンチマークで、物体をプラスチック、金属、ガラス、ゴム、木材の仕上げに明示的にランダム化します。これは、多くのドメインランダム化論文で見られる「同じテーブル、異なるマテリアル」というパターンそのものです。
  • 産業用ビンピッキング研究では、テクスチャの少ない部品や反射する金属部品が、ロボット把持ビジョンの難しい未解決課題として繰り返し挙げられています。マテリアルと照明によって見た目が大きく変化するためです。

本当のボトルネックは 3D モデルではなく、テクスチャです

この領域の多くのチームは、形状面ではすでに必要なものを持っています。CAD エクスポート、スキャンしたメッシュ、ダウンロードしたアセットなどです。足りないのは、同じメッシュに対して、十数個から数百個の現実味があり制作品質の高いマテリアルバリエーションを素早く載せる方法です。既存の選択肢には、それぞれ明確なコストがあります。

このギャップを埋めるために、プロンプト駆動で高速に、PBR までそろったテクスチャ生成が役立ちます。

  • Substance Painter による手作業のテクスチャ制作 — 1 バリエーションごとに数時間かかり、チームに実際の 3D アーティストが必要です。「50 マテリアル × 200 物体クラス」にはスケールしません。
  • スキャン済み CC0 テクスチャライブラリ (ambientCG、Poly Haven、Quixel Megascans など) — 無料でフォトリアルですが、固定カタログです。テストマトリクスに必要な「酸化した緑青銅」や「傷の入ったマットな粉体塗装スチール」が必ずあるとは限らず、モデルの UV に合わせて手作業で調整やタイリングも必要です。
  • プロシージャルなシェーダーグラフ — 無限に変化を作れますが、ノードグラフやシェーダーの専門知識が必要で、多くのロボティクス/ML エンジニアには学習時間を確保しづらい領域です。
  • RoboTwin 2.0 チームのように、LLM で Stable Diffusion 用プロンプトを作り、人手で出力を選別する独自の生成パイプラインを構築する方法。機能はしますが、研究チームが実際にパイプラインを立ち上げるエンジニアリング時間を使っています。また得られたものはフラットなカラー画像であり、Normal、Roughness、Metallic などを含む完全な PBR マテリアルセットではありません。

ステップ別: 3D モデルからドメインランダム化用テクスチャプールへ

まず UV 展開済みの 3D モデルを用意します。これは標準的なシミュレーションアセットのパイプラインでも必要な工程です。NVIDIA SimReady の UV レイアウトガイドでは、複雑なテクスチャマップレイアウトを持つシミュレーションアセットでは、マップを表面に正確に投影するために UV マッピング工程が必要だと説明されています。TextureFast も同じ出発点を前提にしているため、既存ワークフローを置き換えるのではなく、その中にそのまま入ります。

  1. 1

    モデルをアップロードする

    GLB、GLTF、OBJ、FBX に対応しています。GLB は単一の自己完結型バイナリファイルなので、最も手早い形式です。

  2. 2

    マテリアルを説明する、または参照画像を渡す

    「Brushed stainless steel with glare details on the surface」「brand new brown leather, and gray metallic legs」「modern light brown wood with copper metallic parts」などを入力します。写真をアップロードして、プロンプト拡張に残りを補わせることもできます。

  3. 3

    ワンクリックでフル PBR セットを生成する

    TextureFast はまず説明から Base Color/Albedo テクスチャを生成し、その後 Albedo、Normal、Height、Roughness、Metallic、AO の完全なマテリアルを最大 4K 解像度で抽出します。

  4. 4

    新しいマテリアル説明で繰り返す

    各 Base Color テクスチャ生成はおよそ 40 秒なので、同じメッシュに対して 10、30、100 個のマテリアルバリエーションをランダム化プール用に作る作業は、数日がかりのアート制作ではなく、数分単位の作業になります。

  5. 5

    生成したテクスチャセットをランダマイザーに渡す

    マップを Omniverse Replicator のランダム化パラメータ、Unity Perception の TextureRandomizer/MaterialRandomizer アセットリスト、または独自のドメインランダム化スクリプトに入れます。

実例: 1 つのテーブルメッシュ、5 つのマテリアル、半日で完了

典型的なドメインランダム化の例として、仕上げに関係なく「テーブル」を認識する検出器を訓練するための、単一のテーブルメッシュを考えます。

5 つのプロンプト、5 つの PBR 完備の生成結果。それぞれが同じ UV マップ済みメッシュ上に Albedo/Normal/Height/Roughness/Metallic/AO マップを出力します。実作業時間は 15 分未満です。このパターンをビンピッキング、倉庫、家庭内物体の学習セットに含まれる各物体クラスへ広げると、かつて 3D アーティストまたは独自の生成 AI パイプラインが必要だったテクスチャ調達のボトルネックは、半日作業に近づきます。

マテリアルバリエーションプロンプト風の説明
1ナチュラルなオーク木目、サテン仕上げ
2ブラッシュドアルミ、冷たい工業的仕上げ
3軽い緑青のある槌目銅
4マットブラックの粉体塗装スチール
5控えめな凹凸のある白いラミネート

Isaac Sim、Omniverse SimReady、Unity Perception との相性

これは偶然の一致ではありません。出力形式は業界の仕様にかなり近い形になっています。

実際には、TextureFast で生成したマテリアルセットは、ダウンロード後に USD/MDL 変換工程へ渡すか、Unity、Blender、Unreal ベースの合成データパイプラインへそのまま投入しやすい形式です。

  • NVIDIA SimReady のマテリアルガイドでは、PBR Roughness/Metallic ワークフロー、4K 以下でベイクされたテクスチャマップ、小さい物体や遠景物体には 1〜2K をベースラインにすることが推奨されています。これは TextureFast の出力マップセットと解像度上限に合っています。
  • TextureFast がサポートする GLTF、OBJ、FBX、そしてバイナリ GLTF 形式である GLB は、NVIDIA Omniverse のフォーマットガイドにある一般的な USD インポート経路と噛み合います。
  • Unity Perception の TextureRandomizer は、開発者が用意したテクスチャアセットのリストからサンプリングするための仕組みです。ランダム化の機構は提供しますが、テクスチャそのものは提供しません。このワークフローは、まさにその調達ステップを速くします。

この業界では特に重要なプライバシーの話

未発表のロボットハードウェア、未公開の消費者向け製品、独自の産業部品は、この分野では珍しくありません。一方で、多くの生成 AI ツールではアップロードしたジオメトリがどう扱われるのかが不明確なことがあります。TextureFast が掲げる「アップロード資産で学習しない」「資産を公開しない」「NDA セーフ」「完全にプライベートな生成」という方針は、漏えいできないジオメトリを扱うチームにとって、単なるチェック項目ではなく実質的な差別化要素です。

比較: 選択肢を実際に並べるとどう見えるか

TextureFast手作業 (Substance Painter)CC0 スキャン素材ライブラリプロシージャルシェーダーグラフ独自の生成パイプライン
Base Color テクスチャあたりの時間約 40 秒数時間一致する素材があれば数分セットアップ後は数分数週間の構築後は数分
既存スキャンにない任意/具体的なマテリアルはいスキルがあれば可能いいえ — 固定カタログスキルがあれば可能はい
最初からフル PBR マップセットはい (Albedo/Normal/ Height/Roughness/ Metallic/AO)はいはいはい多くの場合いいえ (フラットカラーのみ)
必要なスキルレベル普通の言葉で説明するだけ訓練された 3D アーティスト低いシェーダー/ノードグラフの知識ML/パイプラインエンジニアリング
IP/プライバシー保証100% プライベート、資産で学習しないツール次第該当なし (公開素材)ツール次第構成次第

実際のテクスチャランダム化ワークロードで考える価格感

小規模な研究チームが、たとえば 15〜20 の物体クラスに対して、それぞれ 10〜20 のマテリアルバリエーションを使ってドメインランダム化を行う場合、生成するテクスチャ付きモデルはおよそ 150〜400 個です。これは TextureFast の Starter〜Pro ティアの範囲に十分収まります。数百 SKU にわたる大きな SimReady アセットカタログを構築するチームなら、Business ティアの月間約 2,461 テクスチャ付きモデルに近づきます。どちらの場合でも、1 アセットあたりのコストは、アーティストの時間単価や独自生成パイプラインを立ち上げるエンジニアリング時間と比べて有利です。

よくある質問

テクスチャランダム化はロボットビジョンモデルの精度を本当に改善しますか?それとも単なるリアリズムのためですか?
単なる見た目ではなく、測定可能な効果があります。実物体検出向けの NVIDIA のドメインランダム化論文では、学習パイプラインからランダム化された対象物体テクスチャを取り除くと、アブレーション実験で検出精度が低下しました。テクスチャ変化は、あると嬉しい装飾ではなく、効果の大きいランダム化パラメータの一つです。
NVIDIA Isaac Sim / Omniverse SimReady では、実際にどのテクスチャマップが必要ですか?
SimReady のマテリアルガイドでは、PBR Roughness/Metallic ワークフローと、4K 以下でベイクされたテクスチャマップが推奨されています。小さい物体や遠景物体には 1〜2K が推奨されます。Height や Ambient Occlusion マップは表面の忠実度をさらに高められますが、SimReady の厳密な必須要件というより、ワークフロー上の追加要素です。
AI 生成テクスチャはドメインランダム化に使えますか?フォトグラメトリでスキャンした素材である必要がありますか?
実スキャン素材 (ambientCG など) も AI 生成テクスチャも、公開されているドメインランダム化研究で使われています。重要なのは制作方法そのものではなく、多様性と物理的なもっともらしさです。Tobin et al.Tremblay et al. の研究は、意図的に非フォトリアルなランダムテクスチャでも有効な検出器を訓練できることを示しており、フォトリアルなスタイルと様式化されたスタイルの両方がランダム化プールに居場所を持ちます。
sim-to-real 転移には、物体ごとに何種類のテクスチャバリエーションが必要ですか?
普遍的な数はありません。実環境の視覚的多様性に依存します。ただし公開パイプラインでは、物体ごとに少数の厳選マテリアルを使うものから、数千規模のライブラリまで幅があります。RoboTwin 2.0 の約 11,000 枚の背景テクスチャライブラリは大きい側の例です。まずは物体クラスごとに、素材として明確に異なる 10〜30 種類から始め、その後スケールさせるのが現実的なベースラインです。
この用途では、CC0 テクスチャライブラリと AI テクスチャジェネレーターは何が違いますか?
CC0 ライブラリ (ambientCG、Poly Haven、Quixel Megascans など) は、すでにスキャンされているものを提供する固定カタログです。TextureFast のような AI テクスチャジェネレーターは、プロンプトで説明した、または参照画像で示した特定のマテリアルを、モデル自身の UV に直接合わせて生成します。テスト計画に、事前スキャン素材として存在しない正確なバリエーションが必要なときに重要です。
TextureFast は Unity、Unreal、Omniverse で使えますか?
はい。TextureFast は標準的な PNG PBR マップを出力します。変換後の USD/Omniverse ベースのパイプラインはもちろん、Unity、Unreal Engine、Blender にも投入できます。また、入力として GLB、GLTF、OBJ、FBX モデルを受け付けます。これらは各パイプラインでよく使われる中間形式です。

参考資料

  1. Tobin et al. (2017), Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World
  2. Tremblay et al. (2018), Training Deep Networks with Synthetic Data: Bridging the Reality Gap by Domain Randomization
  3. RoboTwin 2.0 (2025), A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
  4. MuBlE / SHOP-VRB2 (2025), Scaling Manipulation Learning with Visual Kinematic Chain Prediction
  5. ROBI (2021), A Multi-View Dataset for Reflective Objects in Robotic Bin-Picking
  6. NVIDIA Isaac Sim Replicator object-based synthetic dataset generation documentation
  7. NVIDIA SimReady UV layout best practices
  8. NVIDIA SimReady material best practices
  9. NVIDIA Omniverse Asset Importer supported formats
  10. Unity Perception (2021), Generate Synthetic Data for Computer Vision

自分のアセットで試す

UV 展開済みモデルをアップロードし、2 分以内にフル PBR セットを取得

必要なマテリアルを説明してください。資産で学習しない、プライベートな生成です。