SupraTix berichtet über den Abschluss einer ersten Projektphase für SorBERT. Im Mittelpunkt stand die Frage, wie ein Sprachmodell für Obersorbisch mit begrenzten verfügbaren Sprachdaten entwickelt werden kann.
Das Ergebnis dieser Phase ist ein methodischer Entwicklungsrahmen. Ein fertiges oder veröffentlichtes Modell wird damit noch nicht angekündigt.
Welche Fragen untersucht wurden
Nach der Projektbeschreibung wurden Datenquellen gesichtet und auf technische Eignung geprüft. Besondere Aufmerksamkeit galt geringer Textmenge, thematischer Verzerrung sowie fehlerhaften oder vermischten Sprachdaten.
Das geplante Vorgehen verbindet Datenbereinigung, strukturierte Aufbereitung und die Prüfung mehrsprachiger Basismodelle. Aussagen zur Leistungsfähigkeit eines späteren Modells benötigen jedoch dokumentierte Aufgaben, Vergleichswerte und unabhängige Testdaten.
Warum sprachliche Vielfalt eine eigene Aufgabe ist
Joshi und Kollegen zeigen in einer peer-reviewten ACL-Arbeit deutliche Unterschiede bei den verfügbaren Ressourcen und der Repräsentation von Sprachen in der Sprachverarbeitung. Die Untersuchung begründet, warum Verfahren nicht ungeprüft auf jede Sprache übertragbar sind. Sie bewertet SorBERT nicht. ACL, 2020.
Ein Vorgehen für Obersorbisch kann anderen Projekten Anregungen geben. Ob es sich für eine weitere Sprache eignet, hängt von deren Daten, Schrift, Sprachstruktur und Nutzungskontext ab.
Muttersprachliche Prüfung als nächster Schritt
In der folgenden Phase sollen Muttersprachlerinnen und Muttersprachler die Auswahl, Überprüfung und Korrektur von Daten und Modellergebnissen unterstützen. Dabei gehören sprachliche Feinheiten und kulturelle Zusammenhänge ebenso zur Arbeit wie die technische Modellierung.
Vor einer Veröffentlichung sollten Datenrechte, Dokumentation, Testverfahren und bekannte Grenzen geklärt sein. Erst dann lässt sich der Nutzen für konkrete Anwendungen beurteilen.
Die erste Phase schafft dafür eine Grundlage. Sie ist ein Zwischenstand auf dem Weg zu einem überprüfbaren obersorbischen Sprachmodell.