KI · Fünf Minuten
Warum KI GPUs braucht
Ein neuronales Netz besteht aus Millionen Multiplikationen, die alle gleichzeitig passieren können. Ein Grafikchip war schon dafür gebaut.
- Warum parallelEine Netzschicht sind Millionen unabhängiger Multiplikationen
- Echte GrenzeSpeicherbandbreite, nicht Rechenwerke
- TrainingDurchsatzbegrenzt, Tausende Chips
- AnwendungBandbreitenbegrenzt und heute die größere Gesamtlast
Ein Prozessor für allgemeines Rechnen hat eine Handvoll sehr schneller Kerne, die Befehle nacheinander ausführen, mit aufwendiger Maschinerie zum Erraten dessen, was als Nächstes kommt. Er ist ausgezeichnet bei verzweigter, sequenzieller Arbeit.
Ein Grafikprozessor hat Tausende einfacher Kerne, die alle dieselbe Rechnung auf verschiedenen Daten gleichzeitig ausführen. Diese Bauform gibt es, weil einen Bildschirm zu berechnen heißt, dieselbe Rechnung für Millionen Bildpunkte unabhängig auszuführen.
Eine Schicht eines neuronalen Netzes ist eine Matrixmultiplikation: jede Ausgabe ist eine gewichtete Summe jeder Eingabe. Millionen Multiplikationen, alle unabhängig, alle gleichzeitig. Strukturell ist es dasselbe Problem wie das Bildrechnen, und deshalb wurde der für Spiele gebaute Chip zum Motor der künstlichen Intelligenz.
Was das Tempo wirklich begrenzt
Nicht das Rechnen. Die Speicherbandbreite. Um irgendetwas zu berechnen, müssen die Parameter des Modells aus dem Speicher gelesen werden. Ein Modell mit 70 Milliarden Parametern zu je zwei Byte sind 140 Gigabyte, die für jedes erzeugte Token gelesen werden müssen.
Deshalb sind KI-Beschleuniger um sehr schnellen Speicher gebaut, der direkt neben dem Prozessor gestapelt wird, genannt HBM, und deshalb war die Speicherversorgung wiederholt der Engpass der ganzen Branche statt der Waferkapazität. Wenn Sie ein Chipdatenblatt lesen, sagen Speicherbandbreite und Speichermenge die tatsächliche Leistung besser voraus als die Schlagzeilenzahl.
Training und Anwendung sind verschiedene Probleme
Training verarbeitet riesige Stapel und muss Zwischenwerte für den Rückwärtsschritt halten. Es ist durchsatzbegrenzt, läuft wochenlang über Tausende Chips, die mit sehr schnellen Netzen verbunden sind, und das Netzwerk ist ebenso wichtig wie die Chips.
Anwendung erzeugt ein Token nach dem anderen für viele Nutzer gleichzeitig. Sie ist speicherbandbreitenbegrenzt und empfindlich gegenüber Verzögerung. Hier kann andere Hardware gewinnen, weshalb Wettbewerber bei der Anwendung mehr Fortschritt gemacht haben als beim Training.
Die Anwendung verbraucht inzwischen insgesamt mehr Rechenleistung als das Training, denn Training passiert einmal und Anwendung für immer.
Warum die Software so viel zählt wie der Chip
Der beherrschende Anbieter veröffentlichte 2007 eine Programmierplattform und hat fast zwei Jahrzehnte lang Bibliotheken, Übersetzer und abgestimmte Routinen darauf gebaut. Ein Wettbewerber mit besserem Silizium muss trotzdem Tausende bestehender Programme am ersten Tag gut laufen lassen. Diese Lücke ist der Burggraben, und sie schließt sich bei einfachen, wiederkehrenden Lasten am schnellsten.
Was es sonst gibt
Eigene Beschleuniger, die große Cloud-Betreiber für ihre eigenen Lasten bauen und die nie einen öffentlichen Vergleichstest gewinnen müssen. Chips von Neugründungen, die auf die schnelle Anwendung von Transformer-Modellen optimiert sind. Und gewöhnliche Prozessoren, die kleine Modelle problemlos ausführen und die Ihr Telefon nutzt.
Weiterlesen
Langtexte, die das benutzen
KI & Rechenleistung
Das Rennen um die Chips
Alles läuft auf dem Wafer eines anderen
Der KI-Aufschwung ist eine Geschichte über drei Firmen, eine Insel und einen Speichermangel. Wer weiß, wo der Engpass sitzt, versteht das meiste von dem, was mit Kursen, Produkten und Geopolitik passiert.
KI & Rechenleistung
Strom
KI ist heute ein Stromgeschäft
Ein Trainingscluster der Spitzenklasse zieht so viel Strom wie eine Kleinstadt, und die Warteschlange für den Netzanschluss ist inzwischen länger als die für die Chips. Das ist die Beschränkung, die die nächsten fünf Jahre prägt.
Rechner
Rechner dazu
Von GPUs zu Megawatt
Rechenzentrumsstrom
Wie viel Strom ein Verbund aus Beschleunigern zieht, was er im Jahr kostet, wie viel Wärme er abführt und was ein großer Standort vom Netz braucht, aus Chipzahl, Chipleistung, Zuschlag und Strompreis..
ÖffnenVon Token im Monat zu Geld
KI-Kostenrechner
Was eine KI-Funktion im Monat kostet, wenn sie läuft: Anfragen, Token hinein und hinaus, Modellklasse, Zwischenspeicherquote, und der Vergleich mit einer gemieteten GPU für ein selbst betriebenes Modell..
Öffnen