Technical University of Munich
Vision Transformer Framework for Construction Activity Monitoring
Pages
8
Time to read
20 mins
Publication
Language
English
Pages
8
Time to read
20 mins
Publication
Language
English
This technical report presents a framework utilizing Vision Transformers (ViTs) for the automatic classification of construction activity phases, specifically focusing on assembly, transport, and idle stages. The framework addresses the inefficiencies in workflow coordination in modular construction, which often leads to increased idle time and reduced productivity. It employs multi-view timelapse sequences and batch-wise tokenization to process extended video data while maintaining spatio-temporal dependencies. The report evaluates various multi-view fusion strategies, including early, mid, and late fusion, to integrate data from multiple camera streams effectively. The methodology was validated on a prefabricated timber construction site in Germany, demonstrating robust long-term activity recognition and scalable transition detection. The findings indicate that late fusion yields the highest accuracy, while mid fusion performs adequately when aligned with backbone pretraining. This work lays the groundwork for future integration with digital twins in prefabricated construction workflows, aiming to enhance productivity monitoring and improve overall construction efficiency.