Online-Ressource | |
Verfasst von: | Beilharz, Benjamin [VerfasserIn] |
Sun, Xin [VerfasserIn] | |
Karimova, Sariya [VerfasserIn] | |
Riezler, Stefan [VerfasserIn] | |
Titel: | LibriVoxDeEn |
Titelzusatz: | a corpus for German-to-English speech translation and speech recognition |
Verf.angabe: | Benjamin Beilharz, Xin Sun, Sariya Karimova, Stefan Riezler |
E-Jahr: | 2019 |
Jahr: | 18 Oct 2018 |
Umfang: | 5 S. |
Fussnoten: | Gesehen am 24.10.2019 |
Titel Quelle: | Enthalten in: De.arxiv.org |
Ort Quelle: | [S.l.] : Arxiv.org, 1991 |
Jahr Quelle: | 2019 |
Band/Heft Quelle: | (2019) Artikel-Nummer 1910.07924, 5 Seiten |
Abstract: | We present a corpus of sentence-aligned triples of German audio, German text, and English translation, based on German audio books. The corpus consists of over 100 hours of audio material and over 50k parallel sentences. The audio data is read speech and thus low in disfluencies. The quality of audio and sentence alignments has been checked by a manual evaluation, showing that speech alignment quality is in general very high. The sentence alignment quality is comparable to well-used parallel translation data and can be adjusted by cutoffs on the automatic alignment score. To our knowledge, this corpus is to date the largest resource for end-to-end speech translation for German. |
URL: | Bitte beachten Sie: Dies ist ein Bibliographieeintrag. Ein Volltextzugriff für Mitglieder der Universität besteht hier nur, falls für die entsprechende Zeitschrift/den entsprechenden Sammelband ein Abonnement besteht oder es sich um einen OpenAccess-Titel handelt. Volltext: http://arxiv.org/abs/1910.07924 |
Datenträger: | Online-Ressource |
Sprache: | eng |
Bibliogr. Hinweis: | Forschungsdaten Beilharz, Benjamin: LibriVoxDeEn |
Sach-SW: | Computer Science - Computation and Language |
K10plus-PPN: | 1679765345 |
Verknüpfungen: | → Sammelwerk |