研究の概念
複数の基準姿勢の画像をアンカーとして用意し、入力画像に適したアンカーを学習中に選択します。基準姿勢とのずれを小さくすることで、物体認識と姿勢推定を同時に改善します。

概要
棚にある商品を取り出すなど、ロボットアームの実用的な応用には、正確な物体認識と姿勢推定のモデルが不可欠です。
このようなモデルの学習には、物体クラスと姿勢パラメータの両方に適切なラベルを付けた大規模データセットが必要となることが多く、特に正確な姿勢ラベルの収集には大きなコストがかかります。
私たちの先行論文では、同じ物体を基準姿勢で撮影したアンカー画像と入力画像の姿勢の差を推定するように空間変換ネットワークを学習し、明示的な姿勢ラベルを用いずに物体認識と姿勢推定を同時に行うトリプレット学習の枠組みを提案しました。
しかし、その分析から、姿勢の差が大きい入力画像では姿勢推定の精度が大幅に低下することが示されました。
この問題に対して、複数アンカートリプレット学習という新しい学習手法を提案します。
基本的な考え方は、複数のアンカーを用意して基準姿勢を密に配置することで、入力画像との姿勢の差が小さいアンカー画像を少なくとも1枚確保することです。
複数アンカートリプレット学習は、標準的な単一アンカーのトリプレット学習を、複数のアンカーを扱えるように拡張したものです。
多重インスタンス学習の考え方に着想を得て、各入力画像に最適なアンカーを自動選択する選択層を導入し、トリプレットに基づく損失を最小化するようにネットワーク全体を一貫して学習できるようにします。
商品ピッキングを想定した3つのベンチマークデータセットでの実験により、提案手法が物体認識と姿勢推定の両方の精度で既存手法を大きく上回ることを示します。
関連文献
- Shunsuke Yoneda, Kouki Ueno, Go Irie, Masashi Nishiyama, Yoshio Iwai,
Joint Object Recognition and Pose Estimation using Multiple-anchor Triplet Learning of Canonical Plane,
Pattern Recognition Letters (PRL), Vol. 152, pp. 372 - 381, December 2021.