BTC66.174 €-0,68%ETH2.137 €-1,82%SOL86,10 €-1,84%XRP1,16 €-1,74%XAU3.746 €-0,68%XAG55,44 €-0,98%S&P 5006.605 €+0,86%Nasdaq 10025.335 €+0,91%DAX22.057 €+0,82%NVDA188 €-0,03%AAPL287 €+1,75%MSFT427 €+0,65%TSLA315 €+0,52%TSM373 €+1,22%ASML1.467 €+0,64%COIN151 €+1,73%MOOD61GreedBTC66.174 €-0,68%ETH2.137 €-1,82%SOL86,10 €-1,84%XRP1,16 €-1,74%XAU3.746 €-0,68%XAG55,44 €-0,98%S&P 5006.605 €+0,86%Nasdaq 10025.335 €+0,91%DAX22.057 €+0,82%NVDA188 €-0,03%AAPL287 €+1,75%MSFT427 €+0,65%TSLA315 €+0,52%TSM373 €+1,22%ASML1.467 €+0,64%COIN151 €+1,73%MOOD61Greed
All prices
inotok
Das Modell in Ihrer Tasche

KI & Rechenleistung · KI am Rand

Das Modell in Ihrer Tasche

17. Juli 2026 · 3 Min. Lesezeit · Überblick

Ein Modell auf dem Gerät statt im Rechenzentrum laufen zu lassen löst Verzögerung, Datenschutz und Kosten auf einmal. Der Preis ist, dass das Modell klein sein muss, und klein ist eine echte Beschränkung.

Jede KI-Funktion hat eine Platzierungsentscheidung: im Rechenzentrum laufen lassen oder auf dem Gerät in der Hand des Nutzers. Die Cloud gibt Ihnen die größten Modelle und eine Rechnung je Anfrage. Das Gerät gibt Ihnen keine Grenzkosten, keinen Netzweg und Daten, die nie das Haus verlassen, zum Preis eines Modells, das vielleicht ein Hundertstel so groß ist.

Was ein Modell passend macht

Drei Verfahren schrumpfen Modelle genug für den lokalen Betrieb, und alle drei tauschen wenig Qualität gegen viel Größe.

Quantisierung speichert Gewichte mit geringerer Genauigkeit, vier Bit statt sechzehn. Das ist eine Vervierfachung der Dichte bei kleinem und meist hinnehmbarem Qualitätsverlust und der wirksamste einzelne Hebel.

Destillation trainiert ein kleines Modell darauf, ein großes in einem Zielbereich nachzuahmen. Das kleine Modell erreicht den Lehrer allgemein nie, kann ihm aber in dem engen Band, für das es destilliert wurde, nahekommen.

Architekturentscheidungen, etwa je Token nur einen Teil des Netzes zu aktivieren oder Aufmerksamkeitsschlüssel zu teilen, senken die je Token nötige Speicherbandbreite, und genau die begrenzt das Tempo auf einem Telefon.

Die Beschränkung, die überrascht

Es ist nicht die Rechenleistung. Moderne Telefon- und Notebookchips haben eigene neuronale Beschleuniger mit reichlich Rechenwerken. Es sind Speicherbandbreite und thermisches Budget. Ein Token zu erzeugen verlangt, die Gewichte des Modells aus dem Speicher zu lesen, und der Speicherbus eines Telefons ist langsam gegenüber dem Speicher neben einem Rechenzentrumsbeschleuniger. Anhaltende Erzeugung erwärmt das Gerät außerdem, und ein warmes Telefon drosselt binnen einer Minute.

Deshalb sind Modelle auf dem Gerät hervorragend in kurzen Schüben, eine Nachricht zusammenfassen, Sprache mitschreiben, einen Absatz umschreiben, und schlecht in allem, was minutenlang läuft.

Wo lokal klar gewinnt

Datenschutzgebundene Inhalte. Arztnotizen, Nachrichten, Fotos, alles, wo das Versenden ein rechtliches oder ein Rufproblem ist. Das ist das stärkste Argument, und in Europa wird es zunehmend ein regulatorisches.

Ohne Netz und bei schlechter Verbindung. Übersetzung im Ausland, eine Maschine in der Fertigung, ein Fahrzeug im Tunnel.

Häufige kleine Aufgaben. Alles, was ein Nutzer hundertfach am Tag auslöst, wo ein Cloud-Aufruf jeweils einen Bruchteil eines Cents kostet und die Bruchteile sich zu einer echten Rechnung summieren.

Harte Zeitgrenzen. Alles in einem Regelkreis, weshalb Roboterstrategien lokal laufen, selbst wenn ein größeres Modell aus der Ferne verfügbar wäre.

Die Mischform, die tatsächlich ausgeliefert wird

Fast jedes ernsthafte Produkt macht am Ende beides. Ein kleines lokales Modell übernimmt die Routine und entscheidet in wenigen Millisekunden, ob die Frage das große braucht. Der Nutzer sieht meist eine sofortige Antwort und gelegentlich eine etwas langsamere, bessere, und der Betreiber zahlt nur für den Bruchteil, der die Cloud braucht.

Die Wegewahl richtig zu treffen ist die ganze Ingenieuraufgabe, und der ehrliche Weg, sie zu bewerten, ist zu messen, wie oft das lokale Modell etwas beantwortet, das es hätte weiterreichen sollen.

Was das für die Wirtschaftlichkeit heißt

Wenn ein nennenswerter Teil der Anwendung auf Geräte wandert, für die Nutzer bereits bezahlt haben, fallen die Kosten der Auslieferung für den Betreiber, und die Nachfrage nach Rechenzentrumskapazität wächst langsamer, als die geradlinigen Prognosen unterstellen. Wie groß dieser Teil wird, weiß niemand. Es ist die am meisten unterschätzte Größe in jeder Vorhersage des KI-Strombedarfs.

Worauf zu achten ist

Achten Sie auf die Speichermenge gewöhnlicher Telefone und Notebooks, denn daran hängt die Modellgröße auf dem Gerät. Achten Sie darauf, ob Betriebssysteme ein gemeinsames Systemmodell anbieten, das jede App aufrufen kann, was die Doppelung beenden würde, dass jede App ihr eigenes mitbringt. Und achten Sie auf die europäische Datenschutzdurchsetzung, die still das stärkste kaufmännische Argument für lokale Verarbeitung ist.

Fragen, die Leser stellen

Ist ein Modell auf dem Gerät so gut wie eines in der Cloud?

Nein. Es ist typischerweise ein bis zwei Größenordnungen kleiner und merklich schwächer beim Schließen, bei langem Kontext und in der Wissensbreite. Für enge, häufige Aufgaben ist der Abstand klein genug, um nicht zu stören.

Zieht KI auf dem Gerät den Akku leer?

Kurze Schübe kosten sehr wenig. Anhaltende Erzeugung ist thermisch begrenzt und wird sowohl den Akku leeren als auch drosseln, weshalb lange Aufgaben in die Cloud gehen.

Ist lokale KI privater?

Wenn die Verarbeitung wirklich lokal geschieht und nichts zur Protokollierung gesendet wird, ja, deutlich. Der Vorbehalt ist, dass viele Produkte lokale und Cloud-Wege mischen, ohne zu sagen, was was ist.