ロボットビジョン学習データのための AI テクスチャ生成: ドメインランダム化の実践ガイド
要約
ロボットビジョン AI モデルは、表面の見た目に左右されずに物体を認識できるよう、ドメインランダム化という手法で訓練されます。同じ 3D モデルを木材、金属、銅、プラスチック、塗装仕上げなど異なるマテリアルで何百回もレンダリングし、モデルが固定された見た目ではなく形状や機能を学ぶようにする方法です。これまでのボトルネックは、専任の 3D アートチームなしで、フル PBR 品質 (Albedo、Normal、Roughness、Metallic、AO) のマテリアルバリエーションを十分な速度で作ることでした。TextureFast は、UV 展開済みの 3D モデルに対して、テキスト説明または参照画像から約 30〜120 秒で 4K の PBR マテリアルセットを生成します。これにより、合成学習データ向けの実用的なテクスチャランダム化プールを、スタジオではなく 1〜2 人の ML チームでも構築しやすくなります。
ドメインランダム化とは何か、そしてなぜテクスチャが特に効くパラメータなのか
ドメインランダム化は、シミュレーションだけで訓練したビジョンモデルが、実際のカメラ、実際の照明、実際の物体表面に出会ったときに性能低下する「sim-to-real ギャップ」を埋めるための標準的な手法です。NVIDIA の元論文では、照明、姿勢、物体テクスチャなどのシミュレーターパラメータをランダム化することで、モデルが特定のレンダリングを暗記するのではなく、タスクに本質的な特徴を学ぶと説明されています。NVIDIA Isaac Sim Replicator ドキュメントでも、合成データ生成のワークフローで同じ考え方が示されています。
この中で、テクスチャは小さな要素ではありません。ドメインランダム化を実物体検出へ拡張した NVIDIA の CVPR 論文 (Tremblay et al., 2018) では、対象物体のランダム化テクスチャを取り除くと、論文内のアブレーション実験で検出精度が測定可能に低下しました。テクスチャランダム化は、照明と並んでパイプライン全体の中でも重要なレバーの一つでした。
この傾向は、より新しいロボティクス研究にも繰り返し現れています。
つまり、物体検出器や把持姿勢推定器が、ある物体の一つの仕上げしか見たことがないなら、それはまだ物体そのものを学んだとは言えません。写真を覚えただけです。
- RoboTwin 2.0 (2025) は双腕マニピュレーションのベンチマークで、LLM プロンプトと Web クロールで集めた 1,000 件の表面説明から 20,000 枚の AI 画像を生成し、人手で約 11,000 枚の背景テクスチャに絞り込みました。これは、学習に十分なマテリアル多様性を入れるためです。
- SHOP-VRB2 は家庭内物体操作のベンチマークで、物体をプラスチック、金属、ガラス、ゴム、木材の仕上げに明示的にランダム化します。これは、多くのドメインランダム化論文で見られる「同じテーブル、異なるマテリアル」というパターンそのものです。
- 産業用ビンピッキング研究では、テクスチャの少ない部品や反射する金属部品が、ロボット把持ビジョンの難しい未解決課題として繰り返し挙げられています。マテリアルと照明によって見た目が大きく変化するためです。
本当のボトルネックは 3D モデルではなく、テクスチャです
この領域の多くのチームは、形状面ではすでに必要なものを持っています。CAD エクスポート、スキャンしたメッシュ、ダウンロードしたアセットなどです。足りないのは、同じメッシュに対して、十数個から数百個の現実味があり制作品質の高いマテリアルバリエーションを素早く載せる方法です。既存の選択肢には、それぞれ明確なコストがあります。
このギャップを埋めるために、プロンプト駆動で高速に、PBR までそろったテクスチャ生成が役立ちます。
- Substance Painter による手作業のテクスチャ制作 — 1 バリエーションごとに数時間かかり、チームに実際の 3D アーティストが必要です。「50 マテリアル × 200 物体クラス」にはスケールしません。
- スキャン済み CC0 テクスチャライブラリ (ambientCG、Poly Haven、Quixel Megascans など) — 無料でフォトリアルですが、固定カタログです。テストマトリクスに必要な「酸化した緑青銅」や「傷の入ったマットな粉体塗装スチール」が必ずあるとは限らず、モデルの UV に合わせて手作業で調整やタイリングも必要です。
- プロシージャルなシェーダーグラフ — 無限に変化を作れますが、ノードグラフやシェーダーの専門知識が必要で、多くのロボティクス/ML エンジニアには学習時間を確保しづらい領域です。
- RoboTwin 2.0 チームのように、LLM で Stable Diffusion 用プロンプトを作り、人手で出力を選別する独自の生成パイプラインを構築する方法。機能はしますが、研究チームが実際にパイプラインを立ち上げるエンジニアリング時間を使っています。また得られたものはフラットなカラー画像であり、Normal、Roughness、Metallic などを含む完全な PBR マテリアルセットではありません。
ステップ別: 3D モデルからドメインランダム化用テクスチャプールへ
まず UV 展開済みの 3D モデルを用意します。これは標準的なシミュレーションアセットのパイプラインでも必要な工程です。NVIDIA SimReady の UV レイアウトガイドでは、複雑なテクスチャマップレイアウトを持つシミュレーションアセットでは、マップを表面に正確に投影するために UV マッピング工程が必要だと説明されています。TextureFast も同じ出発点を前提にしているため、既存ワークフローを置き換えるのではなく、その中にそのまま入ります。
- 1
モデルをアップロードする
GLB、GLTF、OBJ、FBX に対応しています。GLB は単一の自己完結型バイナリファイルなので、最も手早い形式です。
- 2
マテリアルを説明する、または参照画像を渡す
「Brushed stainless steel with glare details on the surface」「brand new brown leather, and gray metallic legs」「modern light brown wood with copper metallic parts」などを入力します。写真をアップロードして、プロンプト拡張に残りを補わせることもできます。
- 3
ワンクリックでフル PBR セットを生成する
TextureFast はまず説明から Base Color/Albedo テクスチャを生成し、その後 Albedo、Normal、Height、Roughness、Metallic、AO の完全なマテリアルを最大 4K 解像度で抽出します。
- 4
新しいマテリアル説明で繰り返す
各 Base Color テクスチャ生成はおよそ 40 秒なので、同じメッシュに対して 10、30、100 個のマテリアルバリエーションをランダム化プール用に作る作業は、数日がかりのアート制作ではなく、数分単位の作業になります。
- 5
生成したテクスチャセットをランダマイザーに渡す
マップを Omniverse Replicator のランダム化パラメータ、Unity Perception の TextureRandomizer/MaterialRandomizer アセットリスト、または独自のドメインランダム化スクリプトに入れます。
実例: 1 つのテーブルメッシュ、5 つのマテリアル、半日で完了
典型的なドメインランダム化の例として、仕上げに関係なく「テーブル」を認識する検出器を訓練するための、単一のテーブルメッシュを考えます。
5 つのプロンプト、5 つの PBR 完備の生成結果。それぞれが同じ UV マップ済みメッシュ上に Albedo/Normal/Height/Roughness/Metallic/AO マップを出力します。実作業時間は 15 分未満です。このパターンをビンピッキング、倉庫、家庭内物体の学習セットに含まれる各物体クラスへ広げると、かつて 3D アーティストまたは独自の生成 AI パイプラインが必要だったテクスチャ調達のボトルネックは、半日作業に近づきます。
| マテリアルバリエーション | プロンプト風の説明 |
|---|---|
| 1 | ナチュラルなオーク木目、サテン仕上げ |
| 2 | ブラッシュドアルミ、冷たい工業的仕上げ |
| 3 | 軽い緑青のある槌目銅 |
| 4 | マットブラックの粉体塗装スチール |
| 5 | 控えめな凹凸のある白いラミネート |
Isaac Sim、Omniverse SimReady、Unity Perception との相性
これは偶然の一致ではありません。出力形式は業界の仕様にかなり近い形になっています。
実際には、TextureFast で生成したマテリアルセットは、ダウンロード後に USD/MDL 変換工程へ渡すか、Unity、Blender、Unreal ベースの合成データパイプラインへそのまま投入しやすい形式です。
- NVIDIA SimReady のマテリアルガイドでは、PBR Roughness/Metallic ワークフロー、4K 以下でベイクされたテクスチャマップ、小さい物体や遠景物体には 1〜2K をベースラインにすることが推奨されています。これは TextureFast の出力マップセットと解像度上限に合っています。
- TextureFast がサポートする GLTF、OBJ、FBX、そしてバイナリ GLTF 形式である GLB は、NVIDIA Omniverse のフォーマットガイドにある一般的な USD インポート経路と噛み合います。
- Unity Perception の TextureRandomizer は、開発者が用意したテクスチャアセットのリストからサンプリングするための仕組みです。ランダム化の機構は提供しますが、テクスチャそのものは提供しません。このワークフローは、まさにその調達ステップを速くします。
この業界では特に重要なプライバシーの話
未発表のロボットハードウェア、未公開の消費者向け製品、独自の産業部品は、この分野では珍しくありません。一方で、多くの生成 AI ツールではアップロードしたジオメトリがどう扱われるのかが不明確なことがあります。TextureFast が掲げる「アップロード資産で学習しない」「資産を公開しない」「NDA セーフ」「完全にプライベートな生成」という方針は、漏えいできないジオメトリを扱うチームにとって、単なるチェック項目ではなく実質的な差別化要素です。
比較: 選択肢を実際に並べるとどう見えるか
| TextureFast™ | 手作業 (Substance Painter) | CC0 スキャン素材ライブラリ | プロシージャルシェーダーグラフ | 独自の生成パイプライン | |
|---|---|---|---|---|---|
| Base Color テクスチャあたりの時間 | 約 40 秒 | 数時間 | 一致する素材があれば数分 | セットアップ後は数分 | 数週間の構築後は数分 |
| 既存スキャンにない任意/具体的なマテリアル | はい | スキルがあれば可能 | いいえ — 固定カタログ | スキルがあれば可能 | はい |
| 最初からフル PBR マップセット | はい (Albedo/Normal/ Height/Roughness/ Metallic/AO) | はい | はい | はい | 多くの場合いいえ (フラットカラーのみ) |
| 必要なスキルレベル | 普通の言葉で説明するだけ | 訓練された 3D アーティスト | 低い | シェーダー/ノードグラフの知識 | ML/パイプラインエンジニアリング |
| IP/プライバシー保証 | 100% プライベート、資産で学習しない | ツール次第 | 該当なし (公開素材) | ツール次第 | 構成次第 |
実際のテクスチャランダム化ワークロードで考える価格感
小規模な研究チームが、たとえば 15〜20 の物体クラスに対して、それぞれ 10〜20 のマテリアルバリエーションを使ってドメインランダム化を行う場合、生成するテクスチャ付きモデルはおよそ 150〜400 個です。これは TextureFast の Starter〜Pro ティアの範囲に十分収まります。数百 SKU にわたる大きな SimReady アセットカタログを構築するチームなら、Business ティアの月間約 2,461 テクスチャ付きモデルに近づきます。どちらの場合でも、1 アセットあたりのコストは、アーティストの時間単価や独自生成パイプラインを立ち上げるエンジニアリング時間と比べて有利です。
よくある質問
テクスチャランダム化はロボットビジョンモデルの精度を本当に改善しますか?それとも単なるリアリズムのためですか?
NVIDIA Isaac Sim / Omniverse SimReady では、実際にどのテクスチャマップが必要ですか?
AI 生成テクスチャはドメインランダム化に使えますか?フォトグラメトリでスキャンした素材である必要がありますか?
sim-to-real 転移には、物体ごとに何種類のテクスチャバリエーションが必要ですか?
この用途では、CC0 テクスチャライブラリと AI テクスチャジェネレーターは何が違いますか?
TextureFast は Unity、Unreal、Omniverse で使えますか?
参考資料
- Tobin et al. (2017), Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World
- Tremblay et al. (2018), Training Deep Networks with Synthetic Data: Bridging the Reality Gap by Domain Randomization
- RoboTwin 2.0 (2025), A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- MuBlE / SHOP-VRB2 (2025), Scaling Manipulation Learning with Visual Kinematic Chain Prediction
- ROBI (2021), A Multi-View Dataset for Reflective Objects in Robotic Bin-Picking
- NVIDIA Isaac Sim Replicator object-based synthetic dataset generation documentation
- NVIDIA SimReady UV layout best practices
- NVIDIA SimReady material best practices
- NVIDIA Omniverse Asset Importer supported formats
- Unity Perception (2021), Generate Synthetic Data for Computer Vision
自分のアセットで試す
UV 展開済みモデルをアップロードし、2 分以内にフル PBR セットを取得
必要なマテリアルを説明してください。資産で学習しない、プライベートな生成です。