JA EN
体系VLM・マルチモーダル
·★ 会員·論文·11分で読めます

BEV表現を1から — 複数カメラを俯瞰図に統合する

自動運転車が6台のカメラ映像を1枚の「上から見た地図」に変換する仕組みを、透視投影の復習から解説。深度を確率分布で押し出すLSSと、BEV側から問い合わせるTransformer系(BEVFormer)の設計思想の違いまで、前提知識ゼロから追う。

対象imageタスクdetection

Lift

一次資料 — この記事の根拠

この解説の公開 2026-08-12

Lift"arXiv:2008.05711論文ページ·PDF
SplatSplat
https://arxiv.org/abs/2008.05711"Shoot: Encoding Images from Arbitrary Camera Rigs by Implicitly Unprojecting to 3D
BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal TransformersarXiv:2203.17270論文ページ·PDF

なぜ「上から見た地図」が要るのか

サッカー中継を思い浮かべてください。ピッチサイドのカメラ映像は迫力がありますが、「選手Aと選手Bの間が何メートル空いているか」は掴みにくい。だから監督は戦術ボード——ピッチを真上から見た図——で作戦を考えます。距離・位置関係・空きスペースは、上から見た平面図がいちばん素直に表せるからです。

自動運転車もまったく同じ問題を抱えています。車には前後左右を向いた複数のカメラ(例えば6台)が付いていて、それぞれが斜めから見た透視図を写します。しかし「隣の車線の車まで何メートルか」「この隙間に割り込めるか」という判断は、戦術ボードと同じ真上からの地図の上で行いたい。この上から見た表現を BEV(Bird's-Eye View、鳥瞰図) と呼び、複数カメラの透視図を1枚のBEVに統合する仕組みが今回の主題です。

一度BEVにしてしまえば、物体検出も経路計画も「地図上の2次元問題」になり、LiDAR(レーザー距離計)由来の情報とも同じ土俵で混ぜられます。カメラごとにバラバラに検出して後から統合する旧来の方式に対し、先に視点を統一してから考えるのがBEV表現の思想です。

透視投影 — 世界が写真になるとき、何が失われるか

まず「カメラに写る」とはどういう計算かを押さえます。最も単純なピンホールカメラのモデルでは、カメラから見た3次元の点 (X,Y,Z)(X, Y, Z)ZZ が奥行き)は、画像上の位置 (u,v)(u, v) にこう写ります。

u=fxXZ+cx,v=fyYZ+cyu = f_x\,\frac{X}{Z} + c_x,\qquad v = f_y\,\frac{Y}{Z} + c_y
(1)

言い換えると、3次元の座標を奥行き ZZ で割ったものが画像上の位置です。fx,fyf_x, f_y は焦点距離(ズームの度合いを表す定数)、cx,cyc_x, c_y は画像の中心位置で、これらをまとめてカメラの内部パラメータと呼びます。ZZ で割るからこそ、遠くのもの(ZZ が大きい)ほど画像上では小さく写る——これが透視投影です。

重要なのは、この計算が情報を捨てていることです。ZZ で割った瞬間、奥行きの値そのものは画像から消えます。逆に画像の1ピクセルから世界を復元しようとすると、候補は「カメラからそのピクセルの方向へ伸びる光線上のすべての点」——手前1mの虫かもしれないし、50m先のトラックかもしれない。1枚の画像から奥行きは一意に決まらない。この逆問題の解けなさこそが、透視図→俯瞰図の変換を難しくしている根本原因です。

視点変換の直感 — 「失われた奥行きをどう埋めるか」で流派が分かれる

奥行きが消えているなら、何かで補うしかありません。古典的な答えはIPM(逆透視投影)です。「写っているものはすべて地面(高さ0の平面)にある」と仮定すれば、光線と地面の交点として奥行きが一意に決まります。駐車支援のアラウンドビューモニタはこの原理です。しかし車や歩行者のような高さのある物体では仮定が破れ、上のほうほど遠くへ引き伸ばされて歪みます。地面しか信じない変換なので、立体物だらけの走行シーンには足りません。

そこで深層学習ベースの手法は、大きく2つの流派に分かれました。

鍵になるのは「奥行きを1つの値に決めつけない」ことです。推測が自信ありなら分布は尖り、迷っているなら平らになる——この振る舞いは、softmax(合計1の確率分布に変換する関数)の温度と同じ構図です。

FIG 1深度の推測も同じ形のsoftmax分布で表す。自信があるときは1つのビンに尖り、迷っているときは平らになって、特徴が光線上に薄く塗り広げられる

LSS(2020年)は push 型の代表で、名前がそのまま処理の3段階です。

この先にあるもの

§

ここから先は会員限定です

解説記事371本・教科書26章・学生モード48単元・論文精読6本が、月額¥490ですべて読み放題になります。新しい解説は毎日3本ずつ増えます。いつでも解約でき、解約後も期間の終わりまで読めます。

会員の方はログインすると続きが表示されます

参考文献

  1. Lift. "arXiv:2008.05711論文ページ·PDF
  2. Splat. Splat
  3. https://arxiv.org/abs/2008.05711". Shoot: Encoding Images from Arbitrary Camera Rigs by Implicitly Unprojecting to 3D
  4. BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers. arXiv:2203.17270論文ページ·PDF

本記事は上記論文の本文にもとづいて執筆しています。数値・主張は原典を優先してください。

コメント

コメントにはログインが必要です