29.01.2025
12 Min. Lesezeit

Europäische KI-Souveränität ist keine Frage des Budgets im Milliardenbereich, sondern der architektonischen Intelligenz. Das Modell Teuken-7B beweist dies mit einem Trainingsaufwand von nur 14 Millionen Euro und einer Effizienzsteigerung von bis zu 80 Prozent bei agglutinierenden Sprachen. Statt der Skalierungslogik US-amerikanischer Tech-Giganten zu folgen, setzt das Projekt auf präzise Tokenisierung für alle 24 EU-Amtssprachen.

Das Wichtigste in Kürze

  • Teuken-7B ist ein europäisches Open-Source-KI-Modell mit sieben Milliarden Parametern, veröffentlicht Ende November 2024.
  • Das Training erfolgte auf allen 24 EU-Amtssprachen, wobei Englisch lediglich 41,7 Prozent der Datenbasis ausmacht.
  • Durch optimierte Tokenisierung steigt der Trainingsaufwand für Deutsch nur um 20 Prozent gegenüber Englisch, statt um über 55 Prozent wie bei Llama 3.
  • Die Entwicklung kostete 14 Millionen Euro, gefördert durch das Bundesministerium für Wirtschaft und Klimaschutz (BMWK).
  • Die Deutsche Telekom bietet seit dem 12. Dezember 2024 das erste kommerzielle Hosting-Angebot für Unternehmen an.
20 Prozent
Kostenanstieg für Deutsch im Vergleich zu Englisch beim Training von Teuken-7B
80 Prozent
Kosteneinsparung gegenüber anderen Anbietern bei der Verarbeitung agglutinierender Sprachen wie Deutsch, Finnisch oder Ungarisch

„Je weniger Token, desto (energie-)effizienter und schneller generiert ein Sprachmodell die Antwort.“

Token für 24 EU-Amtssprachen

Die Zusammensetzung der Trainingsdaten bei Teuken-7B folgt keiner zufälligen Verteilung, sondern einer klaren strategischen Agenda. Während globale Modelle oft englischzentriert trainiert werden, macht Englisch bei Teuken nur 41,7 Prozent der Trainingsdaten aus. Französisch folgt mit 9,1 Prozent, Deutsch mit 8,7 Prozent und Spanisch mit 8,0 Prozent. Diese Gewichtung stellt sicher, dass auch sprachlich komplexe Strukturen adäquat abgebildet werden. Sprachen wie Finnisch und Ungarisch, die für herkömmliche Tokenizer eine Herausforderung darstellen, erhalten so die notwendige Repräsentation.

Der Name „Teuken“ ist eine direkte Referenz an „Token“, die atomaren Einheiten, in die KI-Modelle Text zerlegen. Die Qualität eines Modells hängt maßgeblich davon ab, wie intelligent dieser Zerlegungsprozess gestaltet ist. Herkömmliche Ansätze, wie sie bei Llama 3 oder Mistral zum Einsatz kommen, neigen dazu, komplexe Wörter willkürlich in viele kleine Fragmente zu splitten. Dies führt zu einem Verlust semantischer Kohärenz. Der eigens entwickelte Tokenizer von Teuken hingegen erkennt morphologische Strukturen und hält zusammengehörige Wortbestandteile intact.

Diese technische Nuance hat direkte Auswirkungen auf die Betriebskosten für Unternehmen. Weniger Token pro Eingabe bedeuten weniger Rechenaufwand pro Inferenz. In Anwendungen mit hohem Textaufkommen, etwa im Kundenservice oder bei der juristischen Dokumentenanalyse, summiert sich dieser Effekt erheblich. Die Fraunhofer-IAIS hat diese Zusammenhänge detailliert dokumentiert, um die Reproduzierbarkeit der Ergebnisse zu sichern. Transparenz ist hierbei kein Marketingversprechen, sondern eine technische Notwendigkeit für vertrauenswürdige KI.

Für CIOs bedeutet dies eine Verschiebung der Prioritäten. Nicht die reine Parameterzahl entscheidet über den Nutzen, sondern die Effizienz der Sprachverarbeitung. Die Verfügbarkeit des Modells als Open Source auf Plattformen wie Hugging Face ermöglicht es Entwicklern und Wissenschaftlern, diese Architektur ohne proprietäre Hürden zu prüfen. Dies fördert die Verbreitung von Technologien, die nicht von einzelnen Vendor-Lock-ins abhängig sind. Die Entscheidung für eine breite Sprachabdeckung ist somit auch eine Entscheidung für langfristige Flexibilität im europäischen Markt.

Training am Supercomputer in Jülich

Die Rechenleistung für das Training von Teuken-7B wurde nicht in externen Cloud-Rechenzentren eingekauft, sondern auf nationaler Infrastruktur bereitgestellt. Der Supercomputer JUWELS am Forschungszentrum Jülich bildete das technologische Rückgrat des Projekts. Auf diesem System wurde das Modell mit sieben Milliarden Parametern auf einer Basis von 500 Milliarden Token trainiert. Dieser Ansatz unterstreicht die Bedeutung lokaler Hochleistungsrechner für die digitale Souveränität. Datenhoheit beginnt bereits in der Trainingsphase, nicht erst bei der Anwendung.

Die Kosteneffizienz dieses Vorgehens ist bemerkenswert und widerlegt die Annahme, dass wettbewerbsfähige KI zwingend Milliardeninvestitionen erfordert. Das gesamte Projektvolumen belief sich auf 14 Millionen Euro, bereitgestellt durch das Bundesministerium für Wirtschaft und Klimaschutz. Im Vergleich zu den Ausgaben US-amerikanischer Konzerne ist dies eine überschaare Summe, die jedoch hohe Wirkung entfaltet. Die Kostenstruktur beim Training zeigt deutliche Vorteile gegenüber etablierten Modellen. Für die deutsche Sprache stieg der Aufwand im Vergleich zu Englisch nur um 20 Prozent.

Zum Vergleich: Bei Llama 3 und GPT-4 lag dieser Aufpreis bei über 55 Prozent, bei Mistral sogar bei über 100 Prozent. Im Durchschnitt schlagen andere Sprachen bei Teuken mit einem Aufpreis von 37 Prozent zu Buche. Bei Llama 3 liegen diese Mehrkosten bei 87 Prozent. Diese Diskrepanz ist für IT-Budgets relevant. Unternehmen, die mehrsprachige Anwendungen betreiben, können ihre Infrastrukturkosten signifikant senken, wenn sie auf ein Modell setzen, das diese Sprachen nativ effizient verarbeitet.

Das Konsortium hinter Teuken vereint führende Forschungseinrichtungen. Neben den Fraunhofer-Instituten IAIS und IIS waren die TU Dresden, das Deutsche Forschungszentrum für Künstliche Intelligenz (DFKI) und das Forschungszentrum Jülich beteiligt. Diese Allianz demonstriert, wie öffentliche Förderung und akademische Exzellenz praxistaugliche Lösungen hervorbringen können. Seit dem 26. November 2024 ist das Modell unter Open-Source-Lizenz verfügbar. Das DFKI hat bereits konkrete Anwendungsfälle für die öffentliche Verwaltung identifiziert, die auf dieser Basis realisiert werden können.

Stärkung der digitalen Souveränität

Digitale Souveränität ist in der aktuellen geopolitischen Lage kein abstraktes Konzept, sondern eine operative Notwendigkeit. Dr. Franziska Brantner, Parlamentarische Staatssekretärin im BMWK, betont, dass Innovationen wie Teuken die Resilienz Deutschlands und Europas stärken. Die Förderung des Projekts ist Teil einer breiteren Strategie zur Reduzierung von Abhängigkeiten. Während in den USA Projekte mit einem Volumen von 43-Milliarden-Euro für KI-Infrastrukturen diskutiert werden, setzt Europa auf gezielte, effiziente Investitionen in spezifische Kompetenzen.

Die Kommerzialisierung erfolgt schrittweise und pragmatisch. Die Deutsche Telekom hat am 12. Dezember 2024 das erste kommerzielle Angebot für Teuken-7B gestartet. Dies ermöglicht Unternehmen, die keine eigene KI-Infrastruktur vorhalten wollen oder können, den Zugang zu souveräner Technologie. Die Möglichkeit, das Modell lokal oder bei einem vertrauenswürdigen europäischen Cloud-Anbieter zu hosten, gibt CIOs die Kontrolle über ihre Datenflüsse zurück. Dies ist insbesondere für Branchen mit hohen Compliance-Anforderungen entscheidend.

Im Finanzsektor, im Gesundheitswesen und in der öffentlichen Verwaltung sind Datenschutzrichtlinien streng. Externe US-Cloud-Dienste stellen hier oft eine rechtliche Grauzone dar. Teuken-7B bietet eine Alternative, die diese Risiken minimiert. Die Open-Source-Lizenzierung erlaubt zudem eine tiefgehende Anpassung an spezifische Unternehmensbedürfnisse. Entwickler können das Modell fine-tunen, ohne auf Blackbox-APIs angewiesen zu sein. Dies beschleunigt die Integration in bestehende IT-Landschaften.

Die OpenGPT-X-Initiative, deren Teil das Projekt ist, vernetzt bereits 26 europäische Partner aus sieben Ländern. Dieses Netzwerk koordiniert die Weiterentwicklung über nationale Grenzen hinweg. Langfristig könnte dies dazu führen, dass europäische Modelle in bestimmten Domänen eine höhere Leistungsdichte aufweisen als globale Konkurrenten. Die Unabhängigkeit von externen APIs sichert die Planbarkeit von IT-Projekten über mehrere Jahre. CIOs erhalten damit ein Instrument, um ihre Roadmaps gegen volatile Marktentwicklungen abzusichern.

Effizienz durch intelligente Architektur

Die Leistungsfähigkeit von Teuken-7B resultiert nicht aus brutaler Rechenpower, sondern aus der Intelligenz seiner Architektur. Der Fokus lag auf der Optimierung der Tokenisierung, da diese direkt den Energieverbrauch und die Antwortgeschwindigkeit beeinflusst. Bei agglutinierenden Sprachen wie Deutsch, Finnisch, Ungarisch, Türkisch, Japanisch und Koreanisch ist dieser Effekt besonders ausgeprägt. In diesen Sprachen werden Bedeutungen oft durch das Aneinanderfügen von Morphemen gebildet. Traditionelle Tokenizer zerlegen diese Konstrukte ineffizient.

Ein Beispiel verdeutlicht den Vorteil: Die Phrase „in meinen Häusern“ kann in einigen Sprachen als ein einziges lexikalisches Item konstruiert werden. Wenn ein Tokenizer dies in fünf oder sechs Einzelteile zerlegt, geht kontextuelle Information verloren. Der neue Ansatz von Teuken behält diese Zusammenhänge besser bei. Dies verbessert nicht nur die Genauigkeit und Kosteneffizienz der Ergebnisse, sondern reduziert auch den Speicherbedarf. Unternehmen, die große Textmengen verarbeiten, können so bis zu 80 Prozent an Ressourcenkosten einsparen.

Diese Architektur-Entscheidung ist ein wirtschaftlicher Hebel. Für IT-Entscheider bedeutet dies, dass europäische Modelle nicht nur aus politischen Gründen, sondern auch aus Kostensicht wettbewerbsfähig sind. Die Kombination aus öffentlicher Förderung, wissenschaftlicher Expertise und kommerzieller Umsetzung durch die Telekom zeigt ein funktionierendes Ökosystem. CIOs sollten dieses Modell daher nicht als Nischenprojekt betrachten, sondern als strategische Option für die Jahre 2025 bis 2027 prüfen.

Die Investition in souveräne Technologie amortisiert sich durch geringere Betriebskosten und höhere Datensicherheit. Es handelt sich um eine echte Option für Entwicklern und Wissenschaftlern sowie für den industriellen Einsatz. Die Fraunhofer-IIS hat die technischen Details in einem Whitepaper veröffentlicht. Dort finden sich Benchmark-Daten im direkten Vergleich zu Llama 3 und Mistral. Diese Daten liefern die notwendige Grundlage für fundierte Kauf- oder Entwicklungsentscheidungen.

Häufige Fragen

Was bedeutet Teuken-7B genau?

Es handelt sich um ein europäisches Open-Source-KI-Sprachmodell mit sieben Milliarden Parametern, das auf allen 24 EU-Amtssprachen trainiert wurde.

Wer hat das Modell entwickelt?

Ein Konsortium unter Federführung der Fraunhofer-Institute für Intelligente Analyse- und Informationssysteme (IAIS) und für integrierte Schaltungen (IIS).

Wie hoch waren die Entwicklungskosten?

Das Projekt wurde vom Bundesministerium für Wirtschaft und Klimaschutz mit 14 Millionen Euro gefördert.

Warum ist Teuken effizienter für deutsche Texte?

Der spezielle Tokenizer zerlegt deutsche Wörter intelligenter, was den Rechenaufwand im Vergleich zu Modellen wie Llama 3 um bis zu 80 Prozent senken kann.

Wo kann man das Modell nutzen?

Teuken-7B ist seit Ende November 2024 auf Hugging Face verfügbar und wird seit dem 12. Dezember 2024 auch kommerziell über die Deutsche Telekom angeboten.

Quelle Titelbild: Pexels / FOTOGRAF

Weiterlesen

Diesen Beitrag teilen:

Auch verfügbar in

Weitere Beiträge

12.09.2026

Oracle lässt Kunden den KI-Ausbau vorfinanzieren

Eva Mickler

5 Min. Lesezeit Oracle hat am 10. September 2026 die Zahlen für das erste Quartal des Geschäftsjahrs ...

Zum Beitrag
11.09.2026

Bundeskanzlei: 3000 Beschäftigte wechseln auf openDesk

Eva Mickler

4 Min. Lesezeit Die Bundeskanzlei in Bern hat am 2. September 2026 nach einer Machbarkeitsstudie ein ...

Zum Beitrag
10.09.2026

Google sichert sich 22 Jahre Atomstrom für Rechenzentren

Eva Mickler

4 Min. Lesezeit Fortum und Google haben am 9. September 2026 einen Stromvertrag über 22 Jahre unterschrieben. ...

Zum Beitrag
09.09.2026

Nvidia kauft Hugging Face für über 11 Milliarden Euro

Eva Mickler

4 Min. Lesezeit Nvidia übernimmt Hugging Face für umgerechnet rund 11,1 Milliarden Euro, Vertrag vom ...

Zum Beitrag
08.09.2026

SAP lässt Roboter direkt von Joule steuern, Haftung offen

Bernhard Liebl

4 Min. Lesezeit SAP hat den ersten Embodied-AI-Jam in der Swiss Smart Factory in Biel dokumentiert. Inspektionsdrohnen ...

Zum Beitrag
07.09.2026

SLB kauft Kelvion: 3,5 Milliarden für KI-Kühlung

Bernhard Liebl

5 Min. Lesezeit Der Öltechnik-Konzern SLB, früher Schlumberger, kauft den Wärmetauscher-Hersteller ...

Zum Beitrag
Ein Magazin der Evernine Media GmbH