Next Article in Journal
AC Fault Ride-Through Strategy for Offshore Wind Power via Diode Rectifier Unit-Based Transmission System
Previous Article in Journal
RETRACTED: Al Hwaitat et al. A New Blockchain-Based Authentication Framework for Secure IoT Networks. Electronics 2023, 12, 3618
Previous Article in Special Issue
The Era of End-to-End Autonomy: Transitioning from Rule-Based Driving to Large Driving Models
 
 
Font Type:
Arial Georgia Verdana
Font Size:
Aa Aa Aa
Line Spacing:
Column Width:
Background:
Article

Ego-Motion-Aware Temporal Fusion in BEV Space for Multi-Modal 3D Object Detection

School of Industry Engineering, Polytechnic University of Catalonia, 08028 Barcelona, Spain
*
Author to whom correspondence should be addressed.
Electronics 2026, 15(18), 4200; https://doi.org/10.3390/electronics15184200
Submission received: 11 August 2026 / Revised: 12 September 2026 / Accepted: 14 September 2026 / Published: 16 September 2026
(This article belongs to the Special Issue Applications of Computer Vision for Autonomous Driving)

Abstract

Multi-modal 3D object detection is critical for autonomous driving perception. While Bird’s Eye View (BEV) fusion methods effectively integrate LiDAR and camera features, they primarily focus on single-frame fusion and neglect temporal context. We propose CamT-BEV, a camera-temporal-enhanced BEV fusion framework for improved multi-modal 3D object detection. Our key insight is that temporal modeling is particularly critical for the camera branch to resolve monocular depth ambiguity and object occlusion, while single-frame LiDAR representation already provides accurate instantaneous geometry. We thus propose a camera-centric temporal enhancement module via ego-motion warping and ConvLSTM temporal encoding. Extensive experiments on the nuScenes dataset demonstrate that CamT-BEV achieves competitive perception performance, attaining 0.6971 NDS and 0.6683 mAP, with notable relative AP gains on challenging categories such as bicycles (+27.3%) and motorcycles (+7.66%) evaluated under category-level mAP (averaged across 0.5 m to 4.0 m distance thresholds). Furthermore, evaluations under fog and miss-beam conditions in nuScenes-C confirm its improved robustness against specific visual and sensor degradations. Crucially, these gains are achieved with low additional computational and memory overhead, demonstrating that targeted camera-temporal fusion is a practical solution for 3D perception.
Keywords: computer vision; intelligent transportation systems; autonomous driving; multi-sensor fusion computer vision; intelligent transportation systems; autonomous driving; multi-sensor fusion

Share and Cite

MDPI and ACS Style

Zhang, N.; Guerra, E.; Grau, A. Ego-Motion-Aware Temporal Fusion in BEV Space for Multi-Modal 3D Object Detection. Electronics 2026, 15, 4200. https://doi.org/10.3390/electronics15184200

AMA Style

Zhang N, Guerra E, Grau A. Ego-Motion-Aware Temporal Fusion in BEV Space for Multi-Modal 3D Object Detection. Electronics. 2026; 15(18):4200. https://doi.org/10.3390/electronics15184200

Chicago/Turabian Style

Zhang, Na, Edmundo Guerra, and Antoni Grau. 2026. "Ego-Motion-Aware Temporal Fusion in BEV Space for Multi-Modal 3D Object Detection" Electronics 15, no. 18: 4200. https://doi.org/10.3390/electronics15184200

APA Style

Zhang, N., Guerra, E., & Grau, A. (2026). Ego-Motion-Aware Temporal Fusion in BEV Space for Multi-Modal 3D Object Detection. Electronics, 15(18), 4200. https://doi.org/10.3390/electronics15184200

Note that from the first issue of 2016, this journal uses article numbers instead of page numbers. See further details here.

Article Metrics

Back to TopTop