der Fachbegriff ist Inverse Text Normalization (ITN).
Wenn du danach suchst, findest du riesige Sammlungen von Regeln und Daten.
Hier sind die besten Ressourcen, um Maps zu befüllen, ohne alles selbst zu tippen:
1. ITN-Regel-Sammlungen (Der “Goldstandard”)¶
itnpy: Ein einfaches, deterministisches Python-Tool genau für diesen Zweck. Es nutzt CSV-Dateien, um gesprochene Wörter in geschriebene Zeichen (Zahlen, Währungen, Daten) zu verwandeln. Die CSVs kannst du fast 1:1 in deine Map kopieren.
NVIDIA NeMo ITN: Sehr mächtig. Sie haben riesige Grammatik-Dateien für fast alle Sprachen. Dort findest du Listen für Maßeinheiten, Titel und Datumsformate.
2. Datenquellen für Punctuation & Case¶
Vosk recasepunc: Das ist das Standard-Tool für Vosk. Es nutzt zwar Modelle, aber im Quellcode finden sich oft Listen für Abkürzungen und Eigennamen, die man extrahieren kann.
Google Text Normalization Dataset: Ein riesiger Datensatz (für eine Kaggle-Challenge erstellt), der Millionen von Beispielen enthält, wie gesprochene Sprache (
spoken) in geschriebene (written) umgewandelt wird.
3. “Diktat-Helfer” Bibliotheken¶
num2words: Wenn du Zahlen-Mapping brauchst, kannst du dir hier die Listen für „eins“ bis „eine Million“ generieren lassen.