News

Artikel zu LLMs in 'Nature' erschienen

07.10.2026

"Retrofitting language models to operate over bytes"

Der Artikel "Retrofitting language models to operate over bytes" ist in der renommierten Fachzeitschrift Nature erschienen. Zu den Autoren zählt als Letztautor der jüngst an das Centrum für Informations- und Sprachverarbeitung der Fakultät berufene Prof. Dr. Dr. Valentin Hofmann.

In ihrer Studie stellt das Autorenteam aus Forschenden der LMU, des Allen Institute for AI, der University of Cambridge, der University of Washington und des Imperial College London eine Methode vor, mit der sich bestehende große Sprachmodelle so umbauen lassen, dass sie Text nicht mehr in Wortbausteinen ("Tokens"), sondern Byte für Byte verarbeiten. Dadurch schneiden die Modelle deutlich besser in Bereichen ab, die für KI-Sprachtechnologie bisher sehr schwierig waren, etwa bei Aufgaben auf Buchstabenebene, aber potenziell auch bei Programmcode oder biologischen Sequenzen.

„Wir glauben, dass die ‚Byteifizierung‘ und LLMs auf Byte-Ebene im Allgemeinen das Potenzial haben, einige seit Langem bestehende Mängel von LLMs zu überwinden“, sagt Valentin Hofmann, Leiter der Studie. „Herkömmliche LLMs haben Schwierigkeiten mit Aufgaben, die Fähigkeiten auf Zeichenebene erfordern, wie zum Beispiel das Rückwärtsbuchstabieren eines Wortes. Unsere ‚byteifizierten‘ Modelle sind darin deutlich besser.“ Diese Fähigkeiten sind mehr als nur eine akademische Spielerei: „Eine gute Darstellung der Feinstruktur von Text ist in vielen Bereichen der Wissenschaft entscheidend, zum Beispiel bei der Arbeit mit Code oder biologischen Sequenzen“, erklärt Hofmann.

Zur Meldung im Newsroom von lmu.de