BTC66.174 €-0,68%ETH2.137 €-1,82%SOL86,10 €-1,84%XRP1,16 €-1,74%XAU3.746 €-0,68%XAG55,44 €-0,98%S&P 5006.605 €+0,86%Nasdaq 10025.335 €+0,91%DAX22.057 €+0,82%NVDA188 €-0,03%AAPL287 €+1,75%MSFT427 €+0,65%TSLA315 €+0,52%TSM373 €+1,22%ASML1.467 €+0,64%COIN151 €+1,73%MOOD61GreedBTC66.174 €-0,68%ETH2.137 €-1,82%SOL86,10 €-1,84%XRP1,16 €-1,74%XAU3.746 €-0,68%XAG55,44 €-0,98%S&P 5006.605 €+0,86%Nasdaq 10025.335 €+0,91%DAX22.057 €+0,82%NVDA188 €-0,03%AAPL287 €+1,75%MSFT427 €+0,65%TSLA315 €+0,52%TSM373 €+1,22%ASML1.467 €+0,64%COIN151 €+1,73%MOOD61Greed
All prices
inotok
12 / 14

KI · Fünf Minuten

Warum KI GPUs braucht

Ein neuronales Netz besteht aus Millionen Multiplikationen, die alle gleichzeitig passieren können. Ein Grafikchip war schon dafür gebaut.

  • Warum parallelEine Netzschicht sind Millionen unabhängiger Multiplikationen
  • Echte GrenzeSpeicherbandbreite, nicht Rechenwerke
  • TrainingDurchsatzbegrenzt, Tausende Chips
  • AnwendungBandbreitenbegrenzt und heute die größere Gesamtlast

Ein Prozessor für allgemeines Rechnen hat eine Handvoll sehr schneller Kerne, die Befehle nacheinander ausführen, mit aufwendiger Maschinerie zum Erraten dessen, was als Nächstes kommt. Er ist ausgezeichnet bei verzweigter, sequenzieller Arbeit.

Ein Grafikprozessor hat Tausende einfacher Kerne, die alle dieselbe Rechnung auf verschiedenen Daten gleichzeitig ausführen. Diese Bauform gibt es, weil einen Bildschirm zu berechnen heißt, dieselbe Rechnung für Millionen Bildpunkte unabhängig auszuführen.

Eine Schicht eines neuronalen Netzes ist eine Matrixmultiplikation: jede Ausgabe ist eine gewichtete Summe jeder Eingabe. Millionen Multiplikationen, alle unabhängig, alle gleichzeitig. Strukturell ist es dasselbe Problem wie das Bildrechnen, und deshalb wurde der für Spiele gebaute Chip zum Motor der künstlichen Intelligenz.

Was das Tempo wirklich begrenzt

Nicht das Rechnen. Die Speicherbandbreite. Um irgendetwas zu berechnen, müssen die Parameter des Modells aus dem Speicher gelesen werden. Ein Modell mit 70 Milliarden Parametern zu je zwei Byte sind 140 Gigabyte, die für jedes erzeugte Token gelesen werden müssen.

Deshalb sind KI-Beschleuniger um sehr schnellen Speicher gebaut, der direkt neben dem Prozessor gestapelt wird, genannt HBM, und deshalb war die Speicherversorgung wiederholt der Engpass der ganzen Branche statt der Waferkapazität. Wenn Sie ein Chipdatenblatt lesen, sagen Speicherbandbreite und Speichermenge die tatsächliche Leistung besser voraus als die Schlagzeilenzahl.

Training und Anwendung sind verschiedene Probleme

Training verarbeitet riesige Stapel und muss Zwischenwerte für den Rückwärtsschritt halten. Es ist durchsatzbegrenzt, läuft wochenlang über Tausende Chips, die mit sehr schnellen Netzen verbunden sind, und das Netzwerk ist ebenso wichtig wie die Chips.

Anwendung erzeugt ein Token nach dem anderen für viele Nutzer gleichzeitig. Sie ist speicherbandbreitenbegrenzt und empfindlich gegenüber Verzögerung. Hier kann andere Hardware gewinnen, weshalb Wettbewerber bei der Anwendung mehr Fortschritt gemacht haben als beim Training.

Die Anwendung verbraucht inzwischen insgesamt mehr Rechenleistung als das Training, denn Training passiert einmal und Anwendung für immer.

Warum die Software so viel zählt wie der Chip

Der beherrschende Anbieter veröffentlichte 2007 eine Programmierplattform und hat fast zwei Jahrzehnte lang Bibliotheken, Übersetzer und abgestimmte Routinen darauf gebaut. Ein Wettbewerber mit besserem Silizium muss trotzdem Tausende bestehender Programme am ersten Tag gut laufen lassen. Diese Lücke ist der Burggraben, und sie schließt sich bei einfachen, wiederkehrenden Lasten am schnellsten.

Was es sonst gibt

Eigene Beschleuniger, die große Cloud-Betreiber für ihre eigenen Lasten bauen und die nie einen öffentlichen Vergleichstest gewinnen müssen. Chips von Neugründungen, die auf die schnelle Anwendung von Transformer-Modellen optimiert sind. Und gewöhnliche Prozessoren, die kleine Modelle problemlos ausführen und die Ihr Telefon nutzt.

Begriffe, die hier vorkommen