RESEARCH

クラス間の分離性が高い説明文の自動生成と対照学習による歩行者の年齢認識

研究の概念

視覚言語モデルで年齢クラスごとの特徴を説明する文章を自動生成し、画像と文章の特徴を対照学習で対応付けます。人手による説明文の試行錯誤を抑えながら、歩行者の年齢認識を改善します。

視覚言語モデルによる年齢説明文の自動生成と対照学習を用いた歩行者年齢認識の概要図

概要

人手を最小限に抑えつつ、全身画像から歩行者の年齢クラスを正確に認識することが求められています。 近年の研究では、視覚言語モデル(VLM)の活用によって年齢認識の精度が向上しています。 しかし、VLMに与える年齢説明文は、年齢クラス間を十分に識別できるように設計されていません。また、説明文の準備には多くの手作業が必要です。 本研究では、年齢クラス間の分離性が高い、クラスごとの詳細な年齢説明文を自動生成し、対照学習の枠組みで利用することで、これらの課題に取り組みます。 提案手法は、各年齢クラスを表す身体的特徴や身に着けているものの特徴の語彙を拡張し、クラス間の分離性を高めます。 VLMを用いた視覚的質問応答(VQA)モジュールにより、簡潔な質問文から、試行錯誤を必要とせずに詳細な年齢説明文を生成します。 年齢説明文から識別性の高いテキスト特徴を得るとともに、対照学習によって、識別性の高い視覚特徴をテキスト特徴に対応付けます。 公開データセット(RAPv2.0、PETA、MSP60k、PA100k)を用いた実験では、平均年齢認識精度84.1%を達成し、最良のベースラインを4.6ポイント上回りました。 また、年齢説明文を手作業で作成する際の試行錯誤を解消できることを確認しました。

関連文献