Datenkompression gehört zu den Technologien, die moderne Computertechnik überhaupt erst praktikabel machen. Fotos, gestreamte Filme, Videoanrufe, Musikbibliotheken, Cloud-Backups und Software-Downloads würden ohne Codecs, die die zu übertragende oder zu speichernde Datenmenge reduzieren, erheblich mehr Speicherplatz und Bandbreite benötigen. Jahrzehntelang basierten solche Codecs hauptsächlich auf sorgfältig entwickelten mathematischen Verfahren und Methoden der Signalverarbeitung. Künstliche Intelligenz verändert diesen Ansatz inzwischen grundlegend. Anstatt dass Entwickler jeden einzelnen Schritt der Kompression manuell festlegen, können neuronale Systeme anhand großer Mengen von Beispieldaten lernen, Bilder, Ton oder Videos besonders effizient darzustellen. Bis 2026 hat sich die neuronale Kompression weit über reine Laborversuche hinausentwickelt, insbesondere bei Bild- und Audiocodierung. Bekannte Codecs wie JPEG, AV1, AV2, VVC, AAC oder Opus zu ersetzen, ist jedoch deutlich anspruchsvoller, als lediglich kleinere Dateien zu erzeugen. Ebenso wichtig sind Kompatibilität, Rechenaufwand, Zuverlässigkeit und langfristige Unterstützung.
Ein traditioneller Codec arbeitet normalerweise mit einer Reihe von Verfahren, die speziell für eine bestimmte Art von Daten entwickelt wurden. Ein Bildcodec kann ein Bild beispielsweise in Blöcke unterteilen, Farb- und Helligkeitsinformationen transformieren, Details entfernen, die für das menschliche Auge kaum wahrnehmbar sind, und die verbleibenden Werte anschließend möglichst effizient speichern. Videocodecs nutzen zusätzlich einen entscheidenden Vorteil: Statt jedes Einzelbild vollständig zu speichern, sagen sie Teile eines Bildes anhand früherer oder späterer Frames voraus. Audiocodecs arbeiten nach ähnlichen Prinzipien und berücksichtigen, welche Klangbestandteile das menschliche Ohr besser oder schlechter wahrnimmt. Moderne Codecs sind äußerst komplex geworden, ihr Verhalten basiert jedoch weiterhin zu einem großen Teil auf Regeln, die von Entwicklern entworfen und über Jahre hinweg verfeinert wurden.
Neuronale Kompression verändert vor allem die Frage, woher diese Regeln stammen. Ein neuronales Netzwerk wird mit zahlreichen Beispielen trainiert und lernt dabei, eine kompakte interne Darstellung der ursprünglichen Daten zu erzeugen. Bei einem Bild kann diese Darstellung beispielsweise Informationen über Formen, Texturen, Kanten und Farben bewahren, während weniger relevante Details verworfen werden. Ein Decoder verwendet anschließend diese komprimierte Darstellung, um ein Bild zu rekonstruieren, das dem Original möglichst ähnlich erscheint. Dasselbe Grundprinzip lässt sich auf Sprache, Musik und Video übertragen. Entwickler entwerfen weiterhin die Gesamtstruktur des Systems und legen fest, wie das Modell trainiert wird, doch zahlreiche Entscheidungen, die in traditionellen Codecs durch fest programmierte Algorithmen getroffen werden, werden vom Modell selbst erlernt.
Besonders interessant ist dieser Ansatz, wenn die wahrgenommene Qualität wichtiger ist als eine mathematisch perfekte Übereinstimmung. Zwei Bilder können sich auf Pixelebene unterscheiden und für einen Menschen dennoch nahezu identisch aussehen. Ein lernbasierter Codec kann darauf trainiert werden, die begrenzte verfügbare Datenmenge vor allem für Merkmale zu verwenden, die für die menschliche Wahrnehmung wichtig sind. Dasselbe Prinzip gilt für Audio: Natürlich klingende Sprache oder klar erkennbare musikalische Details können wichtiger sein als die exakte Rekonstruktion jedes einzelnen Samples. Dies darf jedoch nicht mit verlustfreier Kompression verwechselt werden. Wenn Dokumente, Programme, Datenbanken oder ausführbare Dateien Bit für Bit exakt wiederhergestellt werden müssen, ist eine nur annähernde Rekonstruktion nicht akzeptabel.
Die Kompression von Einzelbildern liefert eines der deutlichsten Beispiele dafür, dass neuronale Codierung inzwischen zu einer praktischen Technologie wird. ISO/IEC 6048-1:2025, besser bekannt als JPEG AI, wurde 2025 als erster internationaler Standard für Bildcodierung veröffentlicht, der auf einem vollständig lernbasierten End-to-End-Ansatz basiert. Weitere JPEG-AI-Spezifikationen für Profile und das Dateiformat folgten 2026. Das ist deshalb wichtig, weil ein erfolgreicher Codec mehr benötigt als ein leistungsfähiges Forschungsmodell. Unterschiedliche Anwendungen müssen kompatible Dateien erstellen, austauschen und decodieren können. JPEG AI definiert dafür einen festgelegten Bitstream und einen standardisierten Decodierungsprozess, anstatt jedem Entwickler ein eigenes, inkompatibles neuronales Kompressionssystem zu überlassen.
Die Forschung zeigt weiterhin, dass lernbasierte Bildkompression die Effizienz klassischer Verfahren übertreffen kann. Im Mai 2026 präsentierten Apple-Forscher einen praktisch einsetzbaren lernbasierten Bildcodec, der sowohl auf wahrgenommene Qualität als auch auf realistische Geräteleistung ausgelegt war. Nach den veröffentlichten Ergebnissen subjektiver Tests erreichte das System deutliche Einsparungen bei der Bitrate im Vergleich zu mehreren modernen Alternativen, darunter AV1, AV2, VVC, JPEG AI und experimentelle Kompressionstechnologien. Die Forscher demonstrierten außerdem die Codierung und Decodierung von Bildern mit 12 Megapixeln direkt auf einem aktuellen Smartphone, anstatt ausschließlich leistungsstarke Rechenzentren zu verwenden. Es handelt sich weiterhin um Forschung und nicht um einen Beweis dafür, dass sämtliche Bildformate sofort ersetzt werden sollten. Die Ergebnisse zeigen jedoch, wie schnell sich der Leistungsunterschied zwischen neuronalen und klassischen Codecs verringert.
Auch Audio ist ein besonders interessantes Einsatzgebiet. Neuronale Audiosysteme wie Google SoundStream und Meta EnCodec lernen kompakte Darstellungen von Sprache, Musik und anderen Klängen. Frühere neuronale Sprachcodecs waren vor allem bei extrem niedrigen Bitraten attraktiv, bei denen traditionelle Codecs häufig deutlich hörbare roboterartige oder metallische Artefakte erzeugen. Neuere Systeme sind für ein breiteres Spektrum an Audiodaten ausgelegt und können überzeugenden Klang mit erstaunlich kleinen Datenmengen erhalten. Neuronale Audiocodecs spielen außerdem bei generativer KI eine wichtige Rolle, da ihre komprimierten Darstellungen als Audio-Tokens für andere Modelle dienen können. Trotzdem sind weit verbreitete Codecs wie Opus im Alltag schwer zu verdrängen, insbesondere bei Telefonaten, Streaming und Browser-Kommunikation, da ihre Implementierungen ausgereift, effizient und auf einer enormen Zahl unterschiedlicher Geräte verfügbar sind.
Der größte Vorteil etablierter Codecs liegt nicht immer in ihrer Kompressionseffizienz, sondern häufig in ihrer Kompatibilität. Ein erfolgreicher Medienstandard kann von Betriebssystemen, Browsern, Grafikprozessoren, Fernsehern, Kameras, Bearbeitungssoftware, Spielkonsolen und Mobilgeräten unterstützt werden. Spezialisierte Hardware kann verbreitete Videoformate mit deutlich geringerem Energieverbrauch decodieren als ein allgemeiner Prozessor, der dieselbe Aufgabe übernimmt. Ein solches Ökosystem zu ersetzen bedeutet, dass Gerätehersteller, Softwareentwickler und Inhaltsanbieter einen neuen Codec ungefähr zur gleichen Zeit unterstützen müssten. Ein neuronaler Codec, der eine Datei um 20 oder 30 Prozent verkleinert, kann in der Praxis dennoch ungeeignet sein, wenn die meisten Nutzer diese Datei ohne zusätzliche Software nicht öffnen können.
Der Rechenaufwand ist eine weitere wichtige Einschränkung. Neuronale Kompression erfordert mathematische Operationen, die auf einem modernen Neural Processing Unit effizient ausgeführt werden können, auf älterer Hardware jedoch deutlich weniger effizient sind. Ein leistungsfähiges Modell kann Netzwerkbandbreite einsparen und gleichzeitig beim Codieren oder Decodieren mehr Energie verbrauchen. Diese Abwägung ist bei Smartphones, Kameras, batteriebetriebenen Geräten und großen Streaming-Diensten relevant, die Millionen von Dateien verarbeiten. Auch die Größe eines Modells spielt eine Rolle, da der Decoder möglicherweise zusätzlichen Speicher oder gespeicherte Parameter des neuronalen Netzes benötigt. Fortschritte bei mobiler KI-Hardware verringern diese Probleme zunehmend, doch ein Vergleich, der ausschließlich die endgültige Dateigröße betrachtet, lässt einen wichtigen Teil der tatsächlichen Kosten außer Acht.
Traditionelle Codecs profitieren außerdem von jahrzehntelangen Tests. Ihr Verhalten bei ungewöhnlichen Bildern, beschädigten Dateien, instabilen Netzwerkverbindungen und unterschiedlichen Hardware-Implementierungen ist gut bekannt. Für Archive, Rundfunkunternehmen und professionelle Produktionsumgebungen kann eine zuverlässig vorhersagbare Decodierung über Jahre oder sogar Jahrzehnte hinweg wichtiger sein als einige zusätzlich eingesparte Megabyte. Neuronale Codecs benötigen deshalb klar definierte Modelle, stabiles Decoderverhalten und eine zuverlässige Versionsverwaltung. JPEG AI ist unter anderem deshalb relevant, weil eine Standardisierung einige dieser Probleme adressiert. Einzelne Forschungs-Codecs können hervorragende Ergebnisse erzielen, doch ein Modell in einem Forschungsarchiv eignet sich nicht automatisch für langfristige Archivierung oder massenhafte Verbreitung.
Aussagen darüber, dass ein Codec besser als ein anderer sei, müssen sorgfältig interpretiert werden. Die kleinste Datei ist nicht automatisch das beste Ergebnis. Kompressionstests vergleichen üblicherweise Bitrate und rekonstruierte Qualität, doch Qualität selbst kann auf verschiedene Weise gemessen werden. Eine mathematische Kennzahl kann ein Bild bevorzugen, das dem Original numerisch besonders ähnlich ist, obwohl ein anderes Bild für menschliche Betrachter besser aussieht. Neuronale Systeme können gezielt auf wahrgenommene Qualität trainiert werden und schneiden deshalb bei Hör- oder Sichttests teilweise besonders gut ab. Auch traditionelle Codecs können jedoch auf ähnliche Ziele optimiert werden. Faire Vergleiche sollten dieselben Ausgangsdaten, vergleichbare Betriebsbedingungen, Codierungszeit, Decodierungszeit und subjektive Qualität berücksichtigen, anstatt sich auf eine einzige Prozentangabe zu stützen.
Außerdem besteht ein wichtiger Unterschied zwischen dem Erhalt tatsächlicher Informationen und der Erzeugung einer überzeugenden Annäherung. Einige experimentelle generative Kompressionsmethoden können plausible Details rekonstruieren, die nicht ausdrücklich übertragen wurden. Bei sehr niedrigen Bitraten kann dadurch beispielsweise ein Gesicht, eine Landschaft oder eine Textur natürlicher wirken als bei einem klassischen Codec mit deutlich sichtbaren Blockartefakten oder Unschärfe. Für bestimmte Unterhaltungs- und Kommunikationsanwendungen kann das sinnvoll sein. Problematisch wird es jedoch, wenn jedes sichtbare Detail Beweiswert besitzt. Überwachungsaufnahmen, wissenschaftliche Bilder, medizinisches Material und technische Inspektionsdaten können die Erhaltung konkreter Merkmale erfordern und nicht lediglich ein realistisch wirkendes Ergebnis. Eine optisch überzeugende Rekonstruktion ist daher nicht automatisch eine originalgetreue Aufzeichnung.
Bei allgemeinen verlustfreien Daten ist die Argumentation für einen vollständigen KI-Ersatz noch schwächer. Kompressionsverfahren für Quellcode, Softwarepakete, Dokumente, Datenbanken und Backups müssen nach der Dekompression exakt dieselbe Bytefolge wiederherstellen. Maschinelles Lernen kann zwar Muster in solchen Daten erkennen und neue Ansätze für die Kompressionsforschung liefern, etablierte Verfahren sind jedoch schnell, vorhersehbar und vergleichsweise kostengünstig. Zudem funktionieren sie ohne ein großes trainiertes Modell, das möglicherweise nur für bestimmte Datentypen optimiert wurde. Für gewöhnliche PC-Speicherung und Dateiarchivierung wird neuronale Kompression deshalb voraussichtlich eher bestehende verlustfreie Verfahren ergänzen, als bekannte Archivierungs- und Kompressionsalgorithmen kurzfristig vollständig zu ersetzen.

Neuronale Kompression entwickelt sich gleichzeitig mit klassischen Codecs weiter, weshalb KI nicht gegen eine unveränderte Technologie konkurriert. Die ITU genehmigte im Januar 2026 eine aktualisierte vierte Ausgabe von H.266 Versatile Video Coding. Auch AOMedia schloss im Mai 2026 die Version 1.0 der AV2-Spezifikation ab. AV2 folgt auf AV1 und zielt auf eine höhere Kompressionseffizienz sowie auf neuere Einsatzgebiete wie anspruchsvolle Bildschirmdarstellungen und immersive Medien. Diese Entwicklungen zeigen, dass traditionelle Codec-Entwicklung keineswegs an ihre Grenzen gelangt ist. Entwickler finden weiterhin bessere Methoden für Vorhersage, Transformation, Codierung und praktische Umsetzung, ohne den gesamten Codec durch ein neuronales Netzwerk ersetzen zu müssen.
Gleichzeitig nehmen die Organisationen, die zukünftige Videostandards entwickeln, künstliche Intelligenz eindeutig ernst. Bei seinem Treffen im Juli 2026 veröffentlichte das Joint Video Experts Team einen Aufruf zur Einreichung neuer Technologien für eine Generation der Videokompression nach VVC. Dabei dürfen sowohl klassische signalverarbeitende Verfahren als auch neuronale Netze und andere KI-basierte Technologien miteinander konkurrieren. Die formale Bewertung der Vorschläge soll 2027 beginnen, während der Abschluss eines ersten Standards der nächsten Generation vorläufig für Ende 2029 vorgesehen ist. Im Jahr 2026 existiert somit noch kein etablierter vollständig neuronaler Nachfolger für die wichtigsten heutigen Videocodecs. Neuronale Verfahren werden jedoch bereits als mögliche Bestandteile der kommenden Generation geprüft.
Eine hybride Entwicklung könnte realistischer sein als eine klare Trennung zwischen KI-Codecs und traditionellen Codecs. Neuronale Netze können einzelne Aufgaben verbessern, während eine etablierte Codec-Struktur weiterhin Bitstream, Zeitsteuerung, Kompatibilität und grundlegende Decodierung übernimmt. Maschinelles Lernen kann beispielsweise Vorhersage, Filterung, Bildwiederherstellung, Bitratensteuerung oder Inhaltsanalyse unterstützen, ohne dass jeder Bestandteil eines Codecs neuronale Technologie verwenden muss. Moderne Prozessoren verfügen zunehmend über spezialisierte Hardware für maschinelles Lernen, wodurch solche Kombinationen praktikabler werden. Dieser schrittweise Ansatz ermöglicht es Entwicklern, einen Teil der Effizienz- oder Qualitätsvorteile von KI zu nutzen und gleichzeitig mehr von der Interoperabilität und dem vorhersehbaren Verhalten etablierter Formate zu erhalten.
Bei einzelnen Anwendungen lautet die Antwort bereits zunehmend ja. Lernbasierte Bildcodierung hat mit JPEG AI den internationalen Standardisierungsprozess erreicht, während neuronale Audiocodecs beeindruckende Ergebnisse bei Sprache mit niedriger Bitrate und allgemeinem Audiomaterial gezeigt haben. Spezialisierte Dienste, die sowohl Codierung als auch Decodierung selbst kontrollieren, können ein neuronales System einsetzen, ohne auf die Unterstützung durch sämtliche Gerätehersteller warten zu müssen. Für den Gesamtmarkt fällt die Antwort jedoch anders aus. Videostreaming, Webmedien, Rundfunk, lokale Speicherung und verlustfreie Datenverarbeitung stellen jeweils unterschiedliche Anforderungen. Derzeit gibt es kein einzelnes neuronales Verfahren, das in all diesen Bereichen einen überzeugenden Ersatz für sämtliche klassischen Codecs darstellt.
Wahrscheinlicher ist, dass sich die Definition eines Codecs selbst verändert. Zukünftige Codecs könnten traditionelle Komponenten, neuronale Bestandteile und Modelle für bestimmte Rekonstruktionsaufgaben kombinieren, während Nutzer lediglich eine unterstützte Datei oder einen Medienstream sehen. In anderen Fällen könnte ein vollständig lernbasierter Codec einen standardisierten Decoder verwenden, sodass Dateien zwischen verschiedenen Anwendungen austauschbar bleiben. Die Grenze zwischen Kompression und KI-Verarbeitung dürfte dadurch zunehmend verschwimmen. Für Nutzer ist letztlich nicht entscheidend, ob sich ein neuronales Netzwerk im Decoder befindet, sondern ob das Ergebnis ausreichende Qualität, Geschwindigkeit, Akkueffizienz, Speicherersparnis und zuverlässige Wiedergabe bietet.
Neuronale Kompression sollte 2026 daher als eigenständige neue Richtung der Codec-Entwicklung betrachtet werden und nicht lediglich als modernes Schlagwort für einen vollständigen Ersatz klassischer Verfahren. Sie hat bereits einen internationalen Bildstandard, praktisch einsetzbare Audiosysteme und Forschungsergebnisse hervorgebracht, die einige der besten traditionellen Methoden herausfordern. Gleichzeitig zeigen AV2, VVC und etablierte verlustfreie Kompressionsverfahren, warum klassische Technologien noch viele Jahre relevant bleiben werden. Bei der Wahl eines Codecs sollten Kompatibilität, Bitrate, Bild- oder Audioqualität, Rechenaufwand, Latenz, Lizenzierung, langfristige Unterstützung und die Notwendigkeit einer exakten Rekonstruktion berücksichtigt werden. KI kann traditionelle Codecs dort ersetzen, wo ihre Vorteile diese Kompromisse rechtfertigen. Insgesamt ist jedoch eher mit einem langfristigen Nebeneinander und einer Kombination beider Ansätze als mit einer vollständigen Ablösung zu rechnen.