研究の概念
物体画像の位置合わせ結果から、領域分割の学習に使う画素単位の擬似アノテーションを生成します。追加の手作業による領域アノテーションを必要とせず、物体認識・姿勢推定・領域分割を組み合わせます。

概要
2次元画像の位置合わせは、物体の姿勢推定と物体認識を同時に行うための自然な選択肢です。
しかし、倉庫の自動化における物体ピッキングで重要となる、物体領域の分割を行うようには設計されていませんでした。
本研究では、2次元画像位置合わせの枠組みに深層領域分割ネットワークのモジュールを導入し、画像位置合わせと物体領域分割を同時に行う統一的な枠組みを提案します。
提案手法では、2次元画像の位置合わせ処理を通じて、領域分割ネットワークの学習用アノテーションを自動生成します。そのため、追加の手作業によるアノテーションは必要ありません。
具体的には、2次元画像の位置合わせ結果から得られる初期物体領域を入力とし、位置合わせ済みの画像対の画素単位の類似度に基づいて、擬似的な画素単位の物体領域を精緻化し、背景画素を除去するように領域分割ネットワークを学習します。
複数のピッキング対象物データセットを用いた実験では、提案手法の領域分割精度が既存の弱教師あり領域分割手法を上回り、同時に、物体認識と姿勢推定でもより高い性能を達成しました。
さらに、提案する領域分割ネットワークのモジュールは、多くの既存の2次元画像位置合わせ手法と円滑に連携しました。
関連文献
- Shunsuke Yoneda, Go Irie, Masashi Nishiyama,
Canonical Plane Segmentation without Annotating Pixel-level Object Regions for Image Registration, IEEE Access, vol. 12, pp. 39484 - 39494, March 2024. - Shunsuke Yoneda, Go Irie, Takashi Shibata, Masashi Nishiyama, Yoshio Iwai,
Deep Segmentation Network without Mask Image Supervision for 2D Image Registration, Proceedings of International Workshop on Frontiers of Computer Vision (FCV), OS5-5, pp. 408 - 422, February 2022. [Short movie]