REPORT Pronobis_Idiap-RR-73-2008/IDIAP Integrating audio and vision for robust automatic gender recognition Pronobis, Marianna Magimai-Doss, Mathew EXTERNAL http://publications.idiap.ch/attachments/reports/2008/Pronobis_Idiap-RR-73-2008.pdf PUBLIC Idiap-RR-73-2008 2008 Idiap November 2008 We propose a multi-modal Automatic Gender Recognition (AGR) system based on audio-visual cues and present its thorough evaluation in realistic scenarios. First, we analyze robustness of different audio and visual features under varying conditions and create two uni-modal AGR systems. Then, we build an integrated audio-visual system by fusing information from each modality at the classifier level. Our extensive studies on the BANCA corpus comprising datasets of varying complexity show that: (a) the audio-based system is more robust than the vision-based system; (b) integration of audio-visual cues yields a resilient system and improves performance in noisy conditions.