
Bild: Olkeri
Von Olkeri.space
Die Sprachlücke der KI: Warum der größte Teil der Welt schlechtere KI bekommt
Überwiegend auf Englisch trainierte Modelle bedienen Milliarden Menschen schlecht. Was das kostet und wer daran arbeitet.
Diesen Artikel lesen auf: English · Français · Español
Künstliche Intelligenz funktioniert am besten auf Englisch, ordentlich in einer Handvoll großer Sprachen und schlecht oder gar nicht in den meisten der Tausenden Sprachen, die Menschen tatsächlich sprechen. Diese Lücke bestimmt, wer von der Technik profitiert.
Warum die Lücke besteht:
Sprachmodelle lernen aus Text. Die Menge verfügbaren digitalen Textes unterscheidet sich zwischen Sprachen um Größenordnungen: Englisch dominiert, gefolgt von einigen weit digitalisierten Sprachen, während die meisten Sprachen der Welt online sehr wenig geschriebenes Material haben.
Ein überwiegend auf englischem Text trainiertes Modell entwickelt starke englische und schwächere sonstige Fähigkeiten, ungefähr im Verhältnis zu den verfügbaren Daten. Bei Sprachen fast ohne digitalen Textbestand kann die Leistung unbrauchbar sein.
Das Problem verstärkt sich selbst. Schlechte Leistung führt dazu, dass weniger Menschen diese Systeme in ihrer Sprache nutzen, was weniger neuen Text erzeugt, was die Daten knapp hält.
Wer betroffen ist:
Das Ausmaß ist unterschiedlich. Große Sprachen wie Chinesisch, Spanisch, Arabisch, Hindi, Portugiesisch, Französisch, Russisch und Japanisch verfügen über beträchtliche Ressourcen und ordentliche Modellleistung, wenn auch unter der englischen.
Darunter liegen Hunderte Sprachen mit jeweils Dutzenden Millionen Sprechern und dünnen digitalen Ressourcen: Suaheli, Amharisch, Yoruba, Hausa, Igbo, bengalische Varietäten, Javanisch, Tagalog, regionale Formen des Vietnamesischen, Kasachisch und viele mehr.
Darunter wiederum Tausende Sprachen mit begrenzter Schrifttradition oder kleinen Sprechergruppen, für die es überhaupt kein kommerzielles Argument für Modellunterstützung gibt.
Afrika ist der am stärksten betroffene Kontinent, mit über 2.000 Sprachen und minimaler Vertretung in den Trainingsdaten. Allein Papua-Neuguinea hat mehr als 800 Sprachen.
Was es kostet:
Die Folgen sind konkret. Ein Bauer, der nur eine lokale Sprache spricht, kann keinen landwirtschaftlichen Beratungsassistenten nutzen. Ein Patient kann einem Diagnosewerkzeug keine Symptome schildern. Eine Bürgerin kommt an keine Verwaltungsleistung. Sprachschnittstellen, die dort am wichtigsten sind, wo die Lesefähigkeit begrenzt ist, sind genau jene, bei denen die Leistungslücken am größten sind.
Die Folge: Jene Bevölkerungen, die von KI-vermitteltem Zugang zu Information und Diensten am meisten profitieren würden, werden von der Technik am schlechtesten bedient.
Es gibt auch eine kulturelle Dimension. Auf englischem Text trainierte Systeme kodieren Annahmen, Bezüge und Rahmungen aus englischsprachigen Zusammenhängen, und die Antworten spiegeln sie auch in Übersetzung.
Wer daran arbeitet:
Die bedeutsamste Arbeit kommt aus den Gemeinschaften. Freiwilligen- und Wissenschaftsnetzwerke in ganz Afrika haben Datensätze, Vergleichstests und Modelle für afrikanische Sprachen gebaut, oft mit minimaler Förderung, und ihre Arbeit ist heute die Grundlage, auf der die meiste afrikanische Sprachtechnologie aufsetzt.
Auch staatliche Programme bestehen. Island fördert isländische Sprachtechnologie ausdrücklich als Kulturpolitik. Indien hat erheblich in Datensätze und Modelle für seine Sprachen investiert, da der Großteil der Bevölkerung kein Englisch nutzt. Schweden, Finnland, Estland, Lettland und andere fördern eigene Sprachmodelle. Die Golfstaaten fördern arabische Fähigkeiten. Japan, Südkorea und Taiwan fördern ihre eigenen.
Die Wirtschaftlichkeit unterscheidet sich grundlegend: Sprachen mit großem Markt ziehen kommerzielle Investitionen an, kleine Sprachen brauchen öffentliche Förderung, und Sprachen, die zugleich klein und arm sind, bekommen weder das eine noch das andere.
Was helfen würde:
Die praktischen Bedürfnisse sind unglamourös: digitalisierter Text, transkribierte Sprache, Bewertungsmaßstäbe und Sprecherinnen und Sprecher, die anständig dafür bezahlt werden, Daten zu erstellen und zu prüfen.
Modelle mit offenen Gewichten helfen hier überproportional, weil eine Gemeinschaft mit einem bescheidenen Datensatz ein bestehendes leistungsfähiges Modell anpassen kann, statt eines von Grund auf zu trainieren, was sonst finanziell unmöglich ist.
Die Lücke schließt sich nicht von selbst. Sie schließt sich dort, wo jemand entscheidet, dass eine Sprache die Investition wert ist, und diese Entscheidung treffen für den größten Teil der Welt derzeit die Märkte.