Vor ein paar Wochen habe ich versucht, einem alten Mini-PC ein 13B-Modell unterzujubeln. Ergebnis: Der Lüfter drehte auf, als würde er starten wollen, die Antwort kam nach zwei Minuten, und sie war trotzdem schlechter als das, was ChatGPT in drei Sekunden ausspuckt. Klassisches Bastelprojekt-Fail. Trotzdem sitze ich seitdem öfter vor einem kleinen Kasten unter dem Fernseher und lasse ihn Texte zusammenfassen, statt jede Anfrage in die Cloud zu schicken. Die Frage, die sich daraus ergibt, ist nicht „Kann ein Mini-PC das?“, sondern „Wann lohnt es sich überhaupt?“
Genau darum geht es hier: nicht um die Fantasie, dass ein Schuhkarton-Rechner GPT-5 ersetzt, sondern um die nüchterne Abwägung, wann ein kleines lokales Modell auf einem Mini-PC dem Cloud-Dienst tatsächlich überlegen ist – und wann Sie sich das Bastelprojekt sparen sollten.
Warum überhaupt lokale KI auf dem Mini-PC?
Der Reiz ist erst mal simpel: Ihre Daten verlassen das Gerät nicht. Wer Dokumenten-Q&A für Verträge, Behandlungsnotizen oder interne Protokolle machen will, schickt diese Inhalte lieber nicht durch fremde Rechenzentren. Ein Mini-PC mit lokalem Modell verarbeitet alles im eigenen Netzwerk, offline, ohne Log irgendwo bei einem Anbieter.
Dazu kommt Latenz. Cloud-Antworten hängen am Netz, an Warteschlangen, an der Tageszeit. Ein lokal laufendes Modell antwortet, sobald die Hardware fertig gerechnet hat – bei kleinen Modellen oft in Sekundenbruchteilen, ohne Roundtrip zum Server. Für Automatisierungen, die im Hintergrund laufen sollen, ist das ein handfester Vorteil.
Für kleine Kanzleien, Arztpraxen oder Handwerksbetriebe, die ohnehin unter DSGVO-Auflagen arbeiten, ist der Datenschutz-Punkt oft der eigentliche Auslöser für das Thema, nicht die Technikbegeisterung. Wer sensible Mandanten- oder Patientendaten zusammenfassen lassen will, muss belegen können, wo diese Daten verarbeitet werden. Ein Mini-PC im eigenen Serverschrank beantwortet diese Frage eindeutig: nirgendwo außerhalb des eigenen Netzwerks. Das ersetzt keine Rechtsberatung, macht die Antwort auf Nachfragen von Aufsichtsbehörden oder Mandanten aber erheblich einfacher, als wenn man erst erklären muss, welcher US-Anbieter die Anfragen verarbeitet und wie lange Logs gespeichert werden.
Und dann ist da die Kostenfrage, die aber differenzierter ist, als es Foren-Threads gern verkaufen. Ein Mini-PC mit lokaler KI läuft laut aktuellen Praxisberichten je nach Gerät und Nutzung mit einem Jahresstromverbrauch von etwa 20 bis 120 Euro – das ist planbar, im Gegensatz zu nutzungsabhängigen API-Rechnungen, die bei intensiver Verwendung schnell explodieren können. Pauschal günstiger ist lokale KI trotzdem nicht automatisch, dazu später mehr. Wer die eigene Kostenstruktur ohnehin systematisch senken will, findet in unserem Beitrag über Strategien zur Reduzierung von KI-Ausgaben weitere Denkanstöße, die sich zum Teil auch auf den Betrieb eines eigenen Mini-PCs übertragen lassen.
RAM ist der Flaschenhals, nicht die CPU
Wer einen Mini-PC für KI kauft, schaut meist zuerst auf den Prozessor. Falscher Fokus. Die eigentliche Grenze ist der Arbeitsspeicher. Aktuelle deutschsprachige Praxisberichte nennen 16 GB RAM als Minimum, wenn lokale KI überhaupt ernsthaft laufen soll, und 32 GB als den Wert, mit dem man wirklich komfortabel arbeitet. 8 GB, wie sie in vielen günstigen Mini-PCs noch verbaut sind, reichen für ernstzunehmende lokale KI-Nutzung nicht mehr aus.
Der Grund ist simpel: Ein Sprachmodell muss komplett oder zumindest in großen Teilen in den Speicher passen, bevor es überhaupt rechnen kann. 7B-Modelle – also Modelle mit rund sieben Milliarden Parametern – lassen sich in 4-Bit-Quantisierung grundsätzlich auf einem Mini-PC mit 16 GB RAM laden. Das funktioniert, ist aber eng, sobald Betriebssystem, Browser und Hintergrunddienste auch noch Speicher wollen. Für robusteren Betrieb, mehrere gleichzeitige Anfragen oder größere Modelle nennen Praxisquellen 32 bis 64 GB RAM als deutlich angenehmere Basis.
Bei der CPU-Klasse zeichnet sich ebenfalls ein Muster ab: Ryzen 7 8845HS oder neuer sowie Intel Core Ultra 7 oder höher gelten als praxistauglich für lokale KI-Inferenz auf Mini-PCs. Ein Intel N100, wie er in vielen Billig-Mini-PCs steckt, wird in denselben Berichten nur für sehr leichte Aufgaben empfohlen – nicht für ernsthafte KI-Workloads. Wer also einen Mini-PC gezielt für KI kauft, sollte eher in RAM und eine aktuelle CPU-Generation investieren als in ein besonders kompaktes Gehäuse.
Welche Modellfamilien überhaupt in Frage kommen
Wer sich zum ersten Mal durch die Modell-Landschaft klickt, verliert schnell die Übersicht: Llama, Mistral, Phi, Gemma, Qwen – die Namen wechseln fast schneller, als man sie sich merken kann. Für den Mini-PC-Einsatz zählt vor allem eine Eigenschaft: Es gibt von praktisch allen relevanten offenen Modellfamilien kleine Varianten im Bereich von etwa 3 bis 8 Milliarden Parametern, die speziell für ressourcenbeschränkte Umgebungen quantisiert wurden. Diese kleinen Varianten sind nicht einfach abgespeckte Notlösungen, sondern eigenständig trainierte oder distillierte Modelle, die versuchen, möglichst viel Fähigkeit in möglichst wenig Speicherbedarf zu packen.
In der Praxis bedeutet das: Es lohnt sich, für den eigenen Anwendungsfall mehrere kleine Modelle auszuprobieren, statt sich auf ein einziges festzulegen. Ein Modell mag bei Zusammenfassungen glänzen, ein anderes bei strukturierten Antworten oder bei mehrsprachigen Aufgaben. Da die Modelldateien meist nur wenige Gigabyte groß sind und sich über Ollama mit einem einzigen Befehl herunterladen und wieder entfernen lassen, ist dieses Ausprobieren kein großer Aufwand – eher ein Nachmittag mit ein paar Testfragen, die für die eigene Nutzung typisch sind.
Ollama und llama.cpp: die Werkzeuge fürs Bastelprojekt
Nerd-Alarm: Ohne die richtige Runtime bleibt jedes Modell nur eine Datei auf der Festplatte. Zwei Namen tauchen in praktisch jeder Anleitung zu lokaler KI auf: Ollama und llama.cpp.
Ollama ist der bequeme Einstieg. Ein Befehl, ein heruntergeladenes Modell, fertig – die Runtime übernimmt Quantisierung, Speicherverwaltung und stellt eine einfache Schnittstelle bereit, über die sich lokale Chats oder eigene Skripte anbinden lassen. Für einen Mini-PC, der abends unter dem Fernseher steht und tagsüber Dokumente zusammenfasst, ist das die pragmatischste Lösung.
llama.cpp ist die Basis darunter, oder zumindest eng verwandt: ein schlankes C++-Projekt, das Modelle so effizient wie möglich auf normaler Consumer-Hardware laufen lässt, auch ohne dedizierte GPU. Wer mehr Kontrolle will – eigene Kompilierflags, spezifische Quantisierungsstufen, experimentelle Modellformate – landet früher oder später bei llama.cpp direkt. Für die meisten Alltagsnutzer reicht aber Ollama völlig, das mittlerweile auch grafische Oberflächen und Erweiterungen im Ökosystem hat.
Genau diese Kombination aus Quantisierung und schlanker Runtime ist der Grund, warum kleine Modelle auf Mini-PCs heute überhaupt alltagstauglich sind. Vor ein paar Jahren wäre die Idee, ein 7B-Modell auf einem Gerät ohne Grafikkarte laufen zu lassen, eine Lachnummer gewesen. Wie stark sich Effizienzgewinne durch angepasste Hardware und Software auch in ganz anderen Bereichen auswirken, zeigt sich übrigens auch bei digitalen Zwillingen in der Industrie, wo ähnliche Kompromisse zwischen Rechenleistung, Kosten und Genauigkeit getroffen werden müssen.

Erste Schritte: So kommt ein Mini-PC überhaupt ins Laufen
Wer das Ganze selbst ausprobieren möchte, muss keine Nacht mit Konfigurationsdateien verbringen. Der übliche Weg beginnt mit der Installation von Ollama auf dem Zielgerät, egal ob unter Linux, Windows oder macOS. Danach lässt sich mit einem einzigen Befehl ein erstes kleines Modell herunterladen und testen – meist eine Variante im Bereich von 7 bis 8 Milliarden Parametern, weil sie den besten Kompromiss zwischen Antwortqualität und Speicherbedarf bietet.
Im zweiten Schritt lohnt sich ein Blick auf die eigene Nutzung: Soll der Mini-PC nur gelegentlich einzelne Fragen beantworten, oder soll er dauerhaft im Hintergrund laufen und etwa E-Mails vorsortieren, Notizen zusammenfassen oder als Baustein einer Smart-Home-Automatisierung dienen? Für den zweiten Fall lohnt es sich, das Modell nicht nur über die Kommandozeile, sondern über eine kleine Schnittstelle anzusprechen, die sich in bestehende Skripte oder Automatisierungstools einbinden lässt. Ollama bringt dafür bereits eine lokale API mit, die sich ähnlich wie ein Cloud-Endpunkt behandeln lässt – nur eben ohne Internetverbindung und ohne laufende Kosten pro Anfrage.
Ein dritter, oft übersehener Schritt ist das Beobachten der eigenen Hardware während der ersten Tage: Wie stark wird der Arbeitsspeicher tatsächlich ausgelastet, wie heiß wird das Gehäuse, wie laut wird der Lüfter bei längeren Anfragen? Diese Beobachtungen entscheiden am Ende, ob 16 GB RAM reichen oder ob eine Aufrüstung auf 32 GB sinnvoller ist, bevor man sich in größere Projekte mit dem Gerät stürzt.
Wann die Cloud trotzdem gewinnt
Im Ernst: Ein kleines lokales Modell ist kein Ersatz für ein großes Cloud-Modell, und das zu behaupten wäre unehrlich. Bei komplexem Reasoning, sehr langen Kontexten oder Aufgaben, die tiefes multimodales Verständnis brauchen – Bilder, Tabellen, Code in Kombination – bleibt die Cloud in der Regel überlegen. Das liegt nicht an schlechter Software, sondern an schlichter Modellgröße: Große Cloud-Modelle haben Parameterzahlen, die kein Mini-PC im Speicher halten kann.
Ein zweiter, oft unterschätzter Punkt: Lokale Modelle können ohne Zusatztools nicht automatisch im Web suchen. Wenn Ihre Anfrage aktuelle Nachrichten, Preise oder frische Fakten braucht, läuft ein rein lokales Setup ins Leere, es sei denn, Sie bauen selbst eine Such-Anbindung drum herum. Das ist möglich, aber zusätzlicher Aufwand, den viele Cloud-Dienste längst eingebaut haben.
Auch bei sehr langen Dokumenten – hundert Seiten Vertrag, komplette Codebasen – stoßen kleine lokale Modelle schneller an ihre Kontextgrenzen als aktuelle Cloud-Flaggschiffe. Ein Heise-Bericht ordnet lokale Modelle inzwischen als „brauchbar“ ein und sieht sie in bestimmten Fällen sogar konkurrenzfähig zu kommerziellen Anbietern – das ist eine praxisbezogene Einschätzung eines Autors, kein allgemeingültiger Benchmark, und sie gilt eben für bestimmte Aufgaben, nicht für alle.
Wer skeptisch bleibt, hat damit übrigens nicht automatisch unrecht. Der Hype um lokale KI läuft manchmal Gefahr, aus einem funktionierenden Nischenwerkzeug ein Allheilmittel zu machen, das es einfach nicht ist. Wer beruflich auf verlässliche, konsistent hochwertige Antworten angewiesen ist – etwa bei Kundenkommunikation, komplexer Analyse oder Aufgaben mit hohem Fehlerrisiko –, sollte lokale Modelle als Ergänzung sehen, nicht als vollwertigen Ersatz. Diese Einordnung mag unspektakulär klingen, ist aber ehrlicher als jedes „lokale KI schlägt die Cloud“-Versprechen.
Die Kosten-Rechnung: Strom, Hardware, Abo
Ist lokale KI wirklich billiger? Die ehrliche Antwort: kommt drauf an. Ein Mini-PC mit passender Ausstattung kostet erst mal Geld, bevor er eine einzige Anfrage beantwortet hat. Dazu kommt der laufende Stromverbrauch, der je nach Gerät und Nutzungsintensität bei geschätzt 20 bis 120 Euro im Jahr liegt. Wer diese Anschaffung gegen ein Cloud-Abo rechnet, muss ehrlich sein: Bei gelegentlicher Nutzung gewinnt fast immer das Abo, einfach weil die Fixkosten der Hardware fehlen.
Interessant wird die Rechnung erst bei intensiver, wiederkehrender Nutzung – etwa wenn ein Mini-PC dauerhaft im Hintergrund Automatisierungen, Zusammenfassungen oder kleine Assistenzaufgaben übernimmt, die bei API-Abrechnung pro Token sonst laufend Kosten erzeugen würden. Genau dann kann sich die einmalige Investition in einen Mini-PC amortisieren. Die pauschale Aussage „lokale KI ist immer billiger“ halte ich für Unsinn – sie blendet Anschaffungskosten und Auslastung aus und funktioniert nur als Marketingsatz, nicht als Rechnung.
Parallelen zur sorgfältigen Kostenplanung zeigen sich übrigens auch in ganz anderen Digitalisierungsfeldern, etwa wenn es um regulatorische Rahmenbedingungen wie beim digitalen Euro oder um neue Technologien wie Quantencomputing geht – auch dort lohnt sich der Blick auf tatsächliche Nutzung statt auf Versprechen. Wer sich für den Einstieg entscheidet, sollte ohnehin nicht nur auf den Kaufpreis schauen, sondern in unserem Grundlagenartikel zu lokaler KI auf Mini-PCs nachlesen, welche Geräteklassen sich für welches Nutzungsprofil eignen – die Hardware-Entscheidung ist am Ende wichtiger als die Frage, welches Modell Sie installieren.
Praxis-Szenarien: Wofür reicht ein kleines Modell wirklich?
Ein kleines lokales Modell auf einem Mini-PC eignet sich gut für Zusammenfassungen von Notizen oder Meeting-Protokollen, für einfache Dokumenten-Q&A auf einer begrenzten Zahl von Dateien, für Textbausteine, Übersetzungen im privaten Rahmen oder als Assistent für Smart-Home-Routinen, bei denen Antworten strukturiert und vorhersehbar sein sollen. Für Bildungszwecke – Karteikarten generieren, Texte vereinfachen, Übungsaufgaben erstellen – gelten Open-Source-Modelle in mehreren Fach-Einordnungen als völlig ausreichend, wobei das naturgemäß von der konkreten Aufgabe abhängt und nicht pauschal auf jedes Fach übertragbar ist.
Schwieriger wird es bei Aufgaben, die Weltwissen jenseits des Trainingsstands brauchen, bei kreativem Schreiben mit hohem Qualitätsanspruch oder bei Programmieraufgaben, die über einzelne Funktionen hinausgehen. Da merkt man dem kleinen Modell an, dass es eben klein ist – nicht dumm, aber begrenzt.
Ein denkbares Alltagsszenario: Ein kleines Unternehmen lässt eingehende Support-Anfragen vom lokalen Modell vorsortieren und kategorisieren, bevor ein Mensch antwortet. Für diese Vorfilterung reicht ein kleines Modell fast immer aus, weil die Aufgabe klar begrenzt ist und Fehler durch die menschliche Nachkontrolle abgefangen werden. Würde man dasselbe Modell aber direkt und unkontrolliert Kundenantworten formulieren lassen, steigt das Risiko unpassender oder falscher Aussagen deutlich – genau der Punkt, an dem viele Unternehmen dann doch wieder auf ein größeres Cloud-Modell oder zumindest auf eine Kombination aus beiden setzen.
Mein persönlicher Eindruck aus der Bastelecke: Für die 80 Prozent der Anfragen, die ich täglich stelle, reicht ein lokales 7B- oder 8B-Modell auf einem gut ausgestatteten Mini-PC völlig aus. Für die restlichen 20 Prozent – komplexe Recherchen, lange Dokumente, kniffliges Debugging – greife ich weiterhin zur Cloud. Diese Mischung, nicht die Entscheidung für das eine oder andere Lager, ist für mich der eigentlich sinnvolle Weg.
Kaufkriterien, wenn Sie einen Mini-PC gezielt für KI wollen
Wer jetzt gezielt kauft, sollte auf drei Dinge achten: mindestens 16 GB RAM, besser 32 GB, damit auch etwas größere Modelle noch Luft haben; eine CPU aus der aktuellen Generation – Ryzen 7 8845HS oder neuer, beziehungsweise Intel Core Ultra 7 oder höher; und, falls das Budget es zulässt, eine dedizierte GPU oder zumindest eine leistungsfähige integrierte Grafikeinheit, die Quantisierung und Inferenz beschleunigt. Ohne GPU wird es bei größeren Modellen schnell eng, kleinere Modelle laufen aber auch rein auf der CPU akzeptabel.
Ein oft vergessener vierter Punkt ist die Kühlung. Mini-PCs sind kompakt gebaut, was bei dauerhafter Auslastung durch KI-Inferenz zu thermischer Drosselung führen kann – die Leistung sinkt dann spürbar, ohne dass es auf den ersten Blick offensichtlich ist. Wer den Rechner regelmäßig über längere Zeiträume voll auslasten will, sollte auf Modelle mit aktiver Lüftung und ausreichend Gehäusevolumen achten, statt auf die kompaktesten und lautlosesten Varianten zu setzen, die für kurze Lastspitzen gedacht sind.
Was bleibt?
Ein Mini-PC mit lokaler KI ist kein Cloud-Ersatz, sondern eine Ergänzung mit klarem Anwendungsbereich: Datenschutz, Latenz, Offline-Fähigkeit, planbare Kosten bei intensiver Nutzung. Für alles, was maximale Modellqualität, aktuelle Web-Informationen oder sehr lange Kontexte braucht, bleibt die Cloud vorerst die bessere Wahl. Die spannende Frage für die nächsten Jahre ist eher, wie stark sich diese Grenze noch verschiebt – RAM-Preise, effizientere Quantisierung und neue CPU-Generationen könnten kleine Modelle auf kompakten Geräten noch deutlich näher an die Cloud heranrücken. Bis dahin bleibt es eine Abwägung, keine Glaubensfrage. Welche Aufgaben würden Sie heute schon einem kleinen Kasten unter dem Fernseher zutrauen?





Was halten Sie von dem Thema? Hier können Sie mit anderen Leserinnen und Lesern ins Gespräch gehen.
Mitreden & diskutieren
Ihre Meinung zählt — teilen Sie Gedanken, Fragen oder Erfahrungen zu diesem Artikel.