BTC66.174 €-0,68%ETH2.137 €-1,82%SOL86,10 €-1,84%XRP1,16 €-1,74%XAU3.746 €-0,68%XAG55,44 €-0,98%S&P 5006.605 €+0,86%Nasdaq 10025.335 €+0,91%DAX22.057 €+0,82%NVDA188 €-0,03%AAPL287 €+1,75%MSFT427 €+0,65%TSLA315 €+0,52%TSM373 €+1,22%ASML1.467 €+0,64%COIN151 €+1,73%MOOD61GreedBTC66.174 €-0,68%ETH2.137 €-1,82%SOL86,10 €-1,84%XRP1,16 €-1,74%XAU3.746 €-0,68%XAG55,44 €-0,98%S&P 5006.605 €+0,86%Nasdaq 10025.335 €+0,91%DAX22.057 €+0,82%NVDA188 €-0,03%AAPL287 €+1,75%MSFT427 €+0,65%TSLA315 €+0,52%TSM373 €+1,22%ASML1.467 €+0,64%COIN151 €+1,73%MOOD61Greed
All prices
inotok
11 / 14

KI · Fünf Minuten

Wie große Sprachmodelle arbeiten

Eine sehr große Funktion, die das nächste Stück Text vorhersagt. Alles, was diese Modelle können, folgt daraus, dass sie das außerordentlich gut tun.

  • EinheitEin Token, etwa drei Viertel eines Wortes
  • ArchitekturTransformer, seit 2017
  • GrößeMilliarden bis Billionen Parameter
  • Warum es erfindetAuf Plausibilität trainiert, nicht auf Wahrheit

Ein Sprachmodell nimmt Text, zerlegt ihn in Token von etwa drei Vierteln eines Wortes und sagt das nächste vorher. Dann hängt es dieses Token an und sagt erneut vorher. Diese Schleife erzeugt alles: Aufsätze, Code, Übersetzung, Zusammenfassungen, Antworten.

Das Modell ist ein Netz aus Milliarden Zahlen, genannt Parameter, die im Training so angepasst werden, dass die Vorhersagen zu echtem Text passen. Niemand schreibt die Parameter; das Training findet sie.

Der Transformer und was Aufmerksamkeit tut

Die Architektur seit 2017 ist der Transformer. Sein Kernmechanismus, die Aufmerksamkeit, lässt das Modell abwägen, wie stark jedes Token der Eingabe seine Deutung jedes anderen beeinflussen soll. So löst es auf, worauf sich ein Fürwort über drei Absätze hinweg bezieht, und deshalb bewältigt es weitreichende Struktur, die frühere Architekturen nicht schafften.

Die drei Stufen der Herstellung

Vortraining. Das nächste Token über einer enormen Textmenge vorhersagen. Hier geht fast die ganze Rechenleistung hin, und hier erwirbt das Modell Grammatik, Fakten und Schlussmuster als Nebenwirkung der Vorhersage.

Feinabstimmung. Weiteres Training an kuratierten Beispielen des gewünschten Verhaltens: hilfreich antworten, Anweisungen folgen, ein Format einhalten.

Präferenztraining. Menschen oder ein anderes Modell ordnen Ausgaben, und das Modell wird zu den bevorzugten hin trainiert. Das prägt Tonfall und Ablehnungsverhalten, und daher kommt das meiste von dem, was Menschen als Persönlichkeit wahrnehmen.

Warum sie Dinge erfinden

Das Modell wurde darauf trainiert, plausiblen Text zu erzeugen, nicht geprüften. Es hat keine Datenbank zum Abgleich und kein inneres Signal, das eine gelernte Tatsache von einem Muster unterscheidet, das nur richtig klingt. Eine selbstsichere, flüssige, falsche Antwort ist keine Störung; es ist derselbe Vorgang, der bei einer Frage arbeitet, deren Muster in die Irre führte.

Abruf aus Quellen hilft: Geben Sie dem Modell den Quelltext in der Eingabe und bitten Sie es, daraus zu antworten. Das verringert Erfindungen erheblich und beseitigt sie nicht.

Das Kontextfenster

Die Textmenge, die das Modell auf einmal berücksichtigen kann. Alles, Ihre Frage, das Gespräch, jedes eingefügte Dokument, muss hineinpassen. Größere Fenster erlauben ganze Codebasen und kosten je Anfrage mehr, denn der Aufwand der Aufmerksamkeit wächst überproportional mit der Länge.

Was sie sind und nicht sind

Sie sind außerordentlich gut darin, Text umzuformen, zu entwerfen, zusammenzufassen, zu übersetzen, zu erklären und Code zu schreiben. Sie sind unzuverlässig beim Rechnen ohne Werkzeuge, bei allem, was aktuelle Informationen verlangt, die sie nicht bekommen haben, und darin zu wissen, was sie nicht wissen.