<?xml version="1.0" encoding="UTF-8"?>
<collection xmlns="http://www.loc.gov/MARC21/slim">
	<record>
		<datafield tag="980" ind1=" " ind2=" ">
			<subfield code="a">REPORT</subfield>
		</datafield>
		<datafield tag="970" ind1=" " ind2=" ">
			<subfield code="a">Awada_Idiap-RR-03-2026/IDIAP</subfield>
		</datafield>
		<datafield tag="245" ind1=" " ind2=" ">
			<subfield code="a">Improving Domain-Specific ASR for Soccer Broadcast Commentary</subfield>
		</datafield>
		<datafield tag="700" ind1=" " ind2=" ">
			<subfield code="a">Awada, Philip</subfield>
		</datafield>
		<datafield tag="700" ind1=" " ind2=" ">
			<subfield code="a">Motlicek, Petr</subfield>
		</datafield>
		<datafield tag="653" ind1="1" ind2=" ">
			<subfield code="a">Automatic Speech Recognition</subfield>
		</datafield>
		<datafield tag="653" ind1="1" ind2=" ">
			<subfield code="a">entity recognition</subfield>
		</datafield>
		<datafield tag="653" ind1="1" ind2=" ">
			<subfield code="a">model fine-tuning</subfield>
		</datafield>
		<datafield tag="653" ind1="1" ind2=" ">
			<subfield code="a">shallow fusion</subfield>
		</datafield>
		<datafield tag="653" ind1="1" ind2=" ">
			<subfield code="a">speech LLMs</subfield>
		</datafield>
		<datafield tag="856" ind1="4" ind2="0">
			<subfield code="i">EXTERNAL</subfield>
			<subfield code="u">http://publications.idiap.ch/attachments/reports/2026/Awada_Idiap-RR-03-2026.pdf</subfield>
			<subfield code="x">PUBLIC</subfield>
		</datafield>
		<datafield tag="088" ind1=" " ind2=" ">
			<subfield code="a">Idiap-RR-03-2026</subfield>
		</datafield>
		<datafield tag="260" ind1=" " ind2=" ">
			<subfield code="c">2026</subfield>
			<subfield code="b">Idiap</subfield>
			<subfield code="a">Rue Marconi 19, Martigny, 1920, Switzerland</subfield>
		</datafield>
		<datafield tag="771" ind1="2" ind2=" ">
			<subfield code="d">August 2026</subfield>
		</datafield>
		<datafield tag="500" ind1=" " ind2=" ">
			<subfield code="a">Semester project as part of Bachelor programme at EPFL.</subfield>
		</datafield>
		<datafield tag="520" ind1=" " ind2=" ">
			<subfield code="a">Pre-trained automatic speech recognition (ASR) models such as OpenAI’s Whisper achieve excellent performance on clean, read speech but degrade significantly on domain-specific audio. This project investigates this degradation on soccer broadcast commentary, where crowd noise, fast-paced delivery, and domain-specific vocabulary, particularly player and
team names, pose challenges. Using the GOAL benchmark and SoccerNet broadcast audio, we fine-tune Whisper Medium on soccer commentary data and explore three inference-time techniques for improving entity recognition without retraining: decoder prompting with match rosters, shallow fusion via sequence biasing, and their combination. The combined approach achieves 88.3% entity detection accuracy, within 2.0 percentage points of the oracle upper bound, and raises unseen entity detection from 27.9% to 67.0%. We find that fine-tuning is a prerequisite for these inference-time techniques: without domain adaptation, prompting and shallow fusion cause severe hallucination. This contrasts with prior results on air traffic control speech, suggesting that domain difficulty determines whether prompting can work without fine-tuning. A companion reproducibility guide details how to replicate all experiments on the EPFL Izar cluster.</subfield>
		</datafield>
	</record>
</collection>