
Bild: Olkeri
Von Olkeri.space
KI-Chips erklärt: Warum GPUs die künstliche Intelligenz der Welt antreiben
Warum Grafikchips zum Motor der künstlichen Intelligenz wurden, worin sich GPUs, TPUs und NPUs unterscheiden und warum die Speicherbandbreite über die tatsächliche KI-Leistung entscheidet.
Diesen Artikel lesen auf: English · Français · Español
Künstliche Intelligenz läuft auf einer schmalen, teuren und strategisch umkämpften Klasse von Hardware. Wer versteht, warum das so ist, versteht vieles an dieser Branche: warum ein Chiphersteller zu einem der wertvollsten Unternehmen der Welt wurde, warum Regierungen Chipexporte als Frage der nationalen Sicherheit behandeln und warum Rechenkapazität die eigentliche Schranke des KI-Fortschritts ist.
Warum ausgerechnet Grafikchips:
Ein neuronales Netz zu trainieren ist mathematisch ein gewaltiger Berg von Matrixmultiplikationen. Dieselbe einfache Rechenoperation wird milliardenfach auf unterschiedlichen Zahlen wiederholt.
Hauptprozessoren, also CPUs, sind für das gegenteilige Problem gebaut. Eine CPU besitzt eine Handvoll leistungsstarker Kerne, optimiert darauf, komplizierte und unvorhersehbare Befehlsfolgen schnell nacheinander abzuarbeiten. Das ist ideal für Betriebssysteme und die meiste Software und schlecht dafür, eine einfache Operation milliardenfach auszuführen.
Grafikprozessoren wurden entworfen, um die Farbe von Millionen Bildpunkten gleichzeitig zu berechnen. Sie besitzen deshalb Tausende einfacherer Kerne, die dasselbe parallel tun. Diese für Videospiele entwickelte Architektur erwies sich als nahezu genau das, was neuronale Netze brauchen.
Ausschlaggebend war die Software. Nvidia veröffentlichte 2007 CUDA und erlaubte Entwicklern damit, GPUs für allgemeine Berechnungen zu programmieren. Als Deep Learning um 2012 abhob, existierte bereits ein ganzes Ökosystem aus Werkzeugen, Bibliotheken und geschulten Ingenieuren. Wettbewerber haben seither vergleichbares Silizium gebaut; dieses Software-Ökosystem einzuholen erwies sich als weit schwieriger.
Der Buchstabensalat: GPU, TPU, NPU und ASIC:
Die GPU ist das universelle Arbeitspferd der KI. Flexibel genug, um jede Modellarchitektur zu trainieren, leistungsfähig genug für die größten Lasten und weltweit in Rechenzentren verfügbar.
Eine TPU, eine Tensor Processing Unit, ist Googles Spezialchip, eigens für Operationen neuronaler Netze gebaut. Spezialisierung schränkt die Flexibilität ein, verbessert aber die Effizienz für die anvisierten Lasten. Mehrere große Technologiekonzerne entwerfen inzwischen eigene Gegenstücke, teils wegen der Leistung, teils um die Abhängigkeit von einem einzigen Lieferanten zu verringern.
Eine NPU, eine Neural Processing Unit, ist ein kleiner, stromsparender Beschleuniger in Telefonen, Notebooks und Kameras. Sie führt bescheidene Modelle lokal aus, damit Fotobearbeitung, Spracherkennung und Übersetzung funktionieren, ohne Daten an einen Server zu schicken. Das verbessert Latenz, Datenschutz und Offline-Fähigkeit.
ASIC ist der Oberbegriff für jeden Chip, der für genau eine Aufgabe entworfen wurde. TPUs und NPUs sind beides Beispiele dafür. Der Zielkonflikt ist stets derselbe: je enger der Zweck, desto besser die Effizienz und desto größer das Risiko, dass sich die Arbeitslast ändert und das Silizium nicht mehr passt.
Training und Inferenz sind verschiedene Probleme:
Das Training baut das Modell. Es ist eine einmalige, enorme Berechnung, für die Tausende Chips wochenlang zusammenarbeiten und Megawatt an Leistung verbrauchen. Die Kosten für das Training eines Spitzenmodells gehen in die Zehner- oder Hundertmillionen Dollar.
Inferenz heißt, das trainierte Modell zur Beantwortung einer Anfrage zu nutzen. Jede einzelne Inferenz ist klein, doch ein erfolgreiches Produkt führt Milliarden davon aus. Über die Lebensdauer eines erfolgreichen Modells übersteigen die Ausgaben für Inferenz an Geld und Energie in der Regel das, was das Training gekostet hat.
Beide Lasten belohnen unterschiedliche Hardware. Training belohnt rohen Durchsatz und schnelle Verbindungen zwischen vielen Chips. Inferenz belohnt geringe Latenz, Speicherkapazität und Kosten pro Anfrage. Zunehmend werden Chips für das eine oder das andere entworfen, nicht für beides.
Die Speicherbandbreite ist der eigentliche Engpass:
Das Marketing betont den rohen Rechendurchsatz, doch in der Praxis begrenzt meist die Speicherbandbreite: wie schnell Daten zwischen Speicher und Rechenkernen fließen.
Moderne Beschleuniger rechnen weit schneller, als der Speicher ihnen Zahlen liefern kann. Kerne stehen still und warten auf Daten. Deshalb ist Speicher mit hoher Bandbreite, kurz HBM, so wichtig. HBM stapelt Speicherchips senkrecht und verbindet sie über sehr breite, sehr schnelle Pfade; sein knappes Angebot hat den gesamten Markt für KI-Hardware wiederholt eingeschnürt. In mehreren jüngeren Phasen war ein Mangel an Speicher und nicht an Prozessoren die bindende Beschränkung.
Chips arbeiten nicht allein:
Ein Spitzenmodell wird auf Tausenden Chips gleichzeitig trainiert, die deshalb ständig Ergebnisse austauschen müssen. Ist das verbindende Netzwerk langsam, warten teure Beschleuniger.
Deshalb ist Netzwerktechnik zum Kern der KI-Infrastruktur geworden, und deshalb werden vollständige Systeme, ganze Racks, in denen Chips, Speicher, Netzwerk und Kühlung gemeinsam entworfen sind, heute als ein einziges Produkt verkauft. Leistung ist eine Eigenschaft des Systems, nicht einer einzelnen Komponente.
Strom und Kühlung wurden zur Schranke:
Die praktische Grenze der KI-Expansion ist zunehmend die Elektrizität. Ein großes KI-Rechenzentrum kann so viel Strom ziehen wie eine Kleinstadt, und das Wachstum der Branche ist mit dem Tempo kollidiert, in dem Netze ausgebaut und Anschlüsse genehmigt werden können.
Auf Leistung folgt Wärme. Dichte KI-Racks haben die Branche von der Luft- zur Flüssigkeitskühlung gedrängt, was den Bau von Rechenzentren verändert. Betreiber wählen Standorte heute ebenso nach Stromverfügbarkeit und Wasserzugang wie nach Netznähe, weshalb Kernkraft, Geothermie und Verträge über eigene Erzeugung Teil der KI-Strategie geworden sind.
Warum Chips zur Geopolitik wurden:
Die Lieferkette hat extreme Nadelöhre. Die fortschrittlichsten Chips fertigt eine kleine Zahl von Foundrys, ganz überwiegend in Taiwan und Südkorea. Die Maschinen, die sie herstellen, insbesondere Anlagen für extrem ultraviolette Lithografie, stammen im Wesentlichen von einem einzigen Unternehmen in den Niederlanden. Ein Großteil der Entwurfssoftware ist amerikanisch.
Diese Konzentration machte Halbleiter zu einem Instrument der Politik. Exportkontrollen regeln, welche Chips an welche Länder verkauft werden dürfen; Subventionsprogramme versuchen, die Fertigung ins eigene Land zu holen; und eine Knappheit oder eine Störung der Lieferwege wird zum wirtschaftlichen Ereignis.
Was das praktisch bedeutet:
Rechenleistung ist der knappe Rohstoff der künstlichen Intelligenz. Der Zugang zu ihr entscheidet, wer Spitzenmodelle trainieren kann, wie schnell Produkte besser werden und was ihr Betrieb kostet.
Für die meisten Organisationen ist die Folgerung schlicht: Sie werden diese Kapazität mieten statt besitzen, Ihre Kosten werden vom Inferenzvolumen getrieben und nicht vom Training, und die Effizienz des gewählten Modells wird Ihr Budget stärker prägen als jede Schlagzeilen-Benchmark.