Kann ein KI-Agent lokal ausgeführt werden?

Ja. Bei einem lokalen KI-Agenten können Modell, Agentenschleife, Speicher, Arbeitsdokumente und Oberfläche auf firmeneigener Hardware liegen. Diese Entscheidungen sind getrennt zu betrachten, denn ein lokaler Prozess kann weiterhin ein externes Modell oder einen externen Dienst nutzen.

Ein KI-Agent kann lokal laufen, wenn seine Arbeitsschleife auf Hardware ausgeführt wird, die der Betreiber kontrolliert. Er erhält ein Ziel, entscheidet mithilfe eines Modells über den nächsten Schritt und kann ein erlaubtes Werkzeug aufrufen. Der Code um das Modell führt dieses Werkzeug aus und gibt das Ergebnis an das Modell zurück. Der technische Leitfaden von freeCodeCamp beschreibt diesen Ablauf und macht die Kontrollgrenze deutlich: Das Modell fordert einen Werkzeugaufruf an, während der umgebende Code die Funktion ausführt. freeCodeCamp

Bei einem lokalen Agenten liegt diese Arbeitsschleife auf der kontrollierten Hardware. Dort können auch das Modell, der Speicher, die Dokumente und die Oberfläche für die Mitarbeiter liegen. Diese Punkte sind jedoch getrennte Entscheidungen. Wenn das gesamte System ohne klare Grenzziehung als „lokal“ bezeichnet wird, kann das eine externe Abhängigkeit verbergen.

LocalAI dokumentiert Agenten, die in einem lokalen Prozess schlussfolgern, Werkzeuge verwenden, Informationen speichern und mit externen Diensten interagieren können. LocalAI

Für ein inhabergeführtes Beratungsunternehmen eignet sich ein einfacher Test: Ordnen Sie jeder Komponente ihren Ausführungsort und jeder Anfrage ihr Ziel zu. Wenn ein lokaler Prozess eine Aufgabe an ein externes Modell sendet oder einen Webdienst aufruft, gehört diese Verbindung in das Betriebsbild. Laut Agentendokumentation von LocalAI können Agenten mit externen Diensten interagieren und einen externen Modellanbieter verwenden. LocalAI

Daraus ergeben sich drei nützliche Bereitstellungsbegriffe:

  • Lokales Modell: Die Modellinferenz findet auf Ihrer Hardware statt. Ollama gibt an, Prompts und Daten nicht zu sehen, wenn Ollama lokal läuft. Cloudgehostete Modelle sind ein anderer Modus. Ollama

  • Lokale Orchestrierung: Agentenschleife, Werkzeugberechtigungen, Zustand und Aufgabenrouting laufen auf Ihrer Hardware. LocalAI dokumentiert lokal ausgeführte Agenten mit Werkzeugen, Speicher, Wissenssammlungen und Konnektoren. LocalAI

  • Bereitstellung auf einer privaten Box: Die ausgewählten lokalen Komponenten laufen auf einem dem Unternehmen zugeordneten Rechner und nicht auf dem Laptop eines einzelnen Mitarbeiters. Das beschreibt eine Betriebsgrenze, keinen bestimmten Software-Stack.

Diese Begriffe können sich überschneiden, sind aber keine Synonyme. Ein brauchbarer Entscheidungsvermerk nennt für jede Arbeitslast den zutreffenden Begriff und jede Verbindung, die die Grenze der Box überschreitet.

Wo liegen Modell, Laufzeitumgebung und Daten?

Beginnen Sie bei der Bewertung des Starter-Kits für selbst gehostete KI mit der Arbeitslast, nicht mit einer Produktliste. Eine lokale Laufzeitumgebung kann Modelle bereitstellen. Eine Agentenschicht kann Anweisungen speichern und Werkzeuge aufrufen. Eine Wissensschicht kann Arbeitsdokumente oder abgerufene Texte speichern. LocalAI verbindet Modelllaufzeit und Agentenfunktionen in einer Steuerungsebene. Das Projekt ist ein Beispiel dafür, was lokal betrieben werden kann, aber keine Aussage über die Komponenten von AI Jungle OS. LocalAI

Das Modell ist nur ein Teil. Der lokale Beispielagent von freeCodeCamp enthält eine lokale Modelllaufzeit, Python-Code, Werkzeugaufrufe und einen kurzfristigen Gesprächsspeicher. Der Leitfaden erklärt auch, dass ein Basismodell die angeforderte Python-Funktion nicht selbst ausführt. Der umgebende Anwendungscode übernimmt den Aufruf. freeCodeCamp

Nutzen Sie bei der Bestandsaufnahme diese Grenzliste:

  • Modellinferenz: Legen Sie fest, ob Prompts und erzeugte Ausgaben auf der Box oder von einem gehosteten Modell verarbeitet werden. Ollama unterscheidet den lokalen Betrieb vom Modus mit cloudgehosteten Modellen. Ollama

  • Agentenorchestrierung: Legen Sie fest, wo Ziele, Werkzeuganfragen, Aufgabenzustand und Agentenkonfiguration verarbeitet werden. LocalAI dokumentiert diese Funktionen in seiner lokalen Agentenplattform. LocalAI

  • Speicher und Wissen: Legen Sie fest, wo Gesprächszustand und Arbeitsdokumente liegen. Der freeCodeCamp-Leitfaden speichert für den Beispielagenten einen kurzfristigen Gesprächsverlauf. LocalAI dokumentiert Möglichkeiten zur lokalen Speicherung einer Wissensbasis. freeCodeCamp LocalAI

  • Werkzeuge und Konnektoren: Erfassen Sie jede Datei- oder Codeaktion, jeden API-Aufruf und jeden externen Dienst, der dem Agenten zur Verfügung steht. LocalAI führt Aktionen und externe Konnektoren als konfigurierbare Agentenfunktionen auf. LocalAI

  • Betreiberoberfläche: Legen Sie fest, wo Mitarbeiter Agenten erstellen, Aktivitäten prüfen und den Dienst überwachen. LocalAI dokumentiert eine Weboberfläche zum Erstellen, Bearbeiten, Verwenden und Überwachen von Agenten. LocalAI

Diese Karte verhindert eine falsche Zweiteilung in „Cloud“ und „lokal“. Ein Unternehmen kann lokale Orchestrierung mit einem gehosteten Modell kombinieren. Für eine Arbeitslast kann es lokale Inferenz und für eine andere einen gehosteten Weg wählen. Der Leitfaden zu privater KI hilft bei der Grenzziehung. Der BYOK-Leitfaden behandelt eine separate Entscheidung über den Modellzugang.

Wie diese Grenze als inhabergeführtes Cockpit dargestellt wird, sehen Sie im AI Jungle OS Cockpit.

Welche Hardware- und Wartungsentscheidungen sind wichtig?

Ob die Hardware passt, hängt vom gewählten Modell, dem Kontext und dem Anfragemuster ab. Laut Ollama-Dokumentation erhöht eine längere Kontextlänge den Speicherbedarf eines Modells. Die FAQ erklärt außerdem, dass die gleichzeitige Verarbeitung vom verfügbaren System- oder GPU-Speicher abhängt. Anfragen können warten, wenn nicht genug Speicher für ein weiteres Modell verfügbar ist. Ollama-Dokumentation zur Kontextlänge Ollama-FAQ

„Eine Box kaufen“ ist deshalb noch keine Hardwareanforderung. Das Unternehmen braucht eine benannte Arbeitslast und einen Abnahmetest. Eine Dokumentenaufgabe, eine Programmieraufgabe und ein mit Geschäftswerkzeugen verbundener Agent können das System unterschiedlich beanspruchen. Machen Sie den Laptop aus einem Projekttutorial nicht zur allgemeinen Empfehlung. Der Autor des freeCodeCamp-Tutorials verwendete ein MacBook Pro mit 32 GB RAM und empfiehlt bei weniger Speicher ein kleineres Modell. Das ist eine Tutorialkonfiguration, keine geschäftliche Vergleichsgröße. freeCodeCamp

Auch die Wartung bleibt bestehen. Ollama dokumentiert Updates, Protokolle, Modellspeicher, Servereinstellungen, Anfragewarteschlangen und Hardwareunterstützung. Ollama LocalAI dokumentiert Authentifizierung, API-Schlüssel, Rollen und Einblick in die Nutzung eines Teamservers. LocalAI

Die folgende Matrix macht aus diesen dokumentierten Variablen Arbeitslasttests. Sie schreibt keinen Stack vor und garantiert keine Eignung. LocalAI belegt die Beispiele zu Agenten, Werkzeugen, Speicher, Konnektoren und Teamsteuerung. Ollama dokumentiert Kontext, Speicher, Parallelität, Warteschlangen, Protokolle und Servereinstellungen. freeCodeCamp zeigt, dass der Anwendungscode und nicht das Modell einen angeforderten Werkzeugaufruf ausführt. LocalAI LocalAI Ollama-Dokumentation zur Kontextlänge Ollama-FAQ freeCodeCamp

Arbeitslast des BeratungsunternehmensMögliche lokale KomponentenMögliche grenzüberschreitende AbhängigkeitZu prüfende HardwarevariableBetriebsaufgabeKonkrete Abnahmeprüfung
Interner DokumentenassistentModellinferenz, Orchestrierung, Arbeitsdokumente und SpeicherEin externer Modellendpunkt oder Konnektor, falls aktiviertGewähltes Modell, Kontextlänge und verfügbarer System- oder GPU-SpeicherUpdates, Dokumentzugriff, Protokolle und Modellspeicher verantwortenEinen repräsentativen Dokumentensatz ausführen, die verlangte Antwort bestätigen und prüfen, ob eine Anfrage die Box verlässt
Backoffice-Ablauf mit WerkzeugenAgentenschleife, Werkzeugberechtigungen, Aufgabenzustand, Speicher und optional InferenzDie Geschäfts-API oder der externe Dienst, den ein erlaubtes Werkzeug aufruftGewähltes Modell, Kontextlänge, gleichzeitiges Anfragemuster und verfügbarer SpeicherWerkzeugzugriff, Zugangsdaten, Protokolle, Warteschlangen und Updates verantwortenEine erlaubte Aktion mit Testdaten ausführen, das erwartete Systemergebnis bestätigen und sicherstellen, dass ein nicht erlaubtes Werkzeug nicht verfügbar ist
Gemeinsam genutzter MitarbeiterassistentAgentenkonfiguration, Oberfläche, Wissensspeicher, Orchestrierung und optional InferenzEin externer Modellanbieter, Konnektor oder für Mitarbeiter freigegebener NetzwerkpfadGewähltes Modell, Kontextlänge, gleichzeitige Mitarbeiteranfragen und verfügbarer SpeicherAuthentifizierung, Rollen, Nutzungsprüfung, Servereinstellungen und Updates verantwortenJede Mitarbeiterrolle mit ihrem erlaubten Agenten testen, eine nicht authentifizierte Anfrage ablehnen und die Sichtbarkeit der Aktivität für den Betreiber prüfen

Nutzen Sie die folgende Tabelle, bevor Sie einen Bereitstellungsweg wählen.

BereitschaftsfrageEin lokaler Weg oder eine private Box ist bereit, wennZuerst muss nachgebessert werden, wenn
Welche Aufgabe soll der Agent ausführen?Arbeitslast und erlaubte Werkzeuge sind schriftlich festgehalten„Allgemeine KI-Hilfe“ ist die einzige Beschreibung
Was muss auf kontrollierter Hardware bleiben?Jede lokale Komponente und externe Verbindung ist zugeordnetFür „alles lokal“ gibt es keine Grenzkarte
Welches Modell und welcher Kontext sind erforderlich?Das Team verfügt über einen Test für die ArbeitslastDie Hardware wird anhand eines Tutorials gewählt
Wer ist für den laufenden Betrieb zuständig?Eine Person verantwortet Updates, Protokolle, Zugriff und ServereinstellungenDie Verantwortung endet nach der Installation
Wie nimmt das Unternehmen das Ergebnis ab?Die Aufgabe hat beobachtbare AbnahmekriterienDer Erfolg hängt von einem offenen Eindruck ab

Die Tabelle prüft die Bereitschaft. Sie ist keine Formel zur Hardwaredimensionierung. Ein Unternehmen, das die Arbeitslast nicht benennen kann, kann nicht prüfen, ob die ausgewählte Box passt. Ohne benannten Betreiber ist die Wartungsarbeit nicht zugewiesen.

Vergleichen Sie für die kaufmännische Entscheidung die Verantwortungsgrenze im Leitfaden „Private Box oder SaaS“. Prüfen Sie den aktuellen Leistungsweg unter Preise, ohne davon auszugehen, dass die Hardwarewahl das Betriebsmodell festlegt.

Sind lokale Agenten standardmäßig privat?

Nein. Ein lokaler Prozess ist keine vollständige Datenschutzaussage. Sie müssen weiterhin Modellmodus, Werkzeugaufrufe, Konnektoren, Netzwerkfreigabe, gespeicherten Zustand und Betreiberzugriff prüfen.

Ollama gibt an, Prompts und Daten nicht zu sehen, wenn Ollama lokal läuft. Dieselbe FAQ erklärt, dass cloudgehostete Modelle Prompts und Antworten zur Bereitstellung dieses Dienstes verarbeiten. Sie dokumentiert außerdem eine rein lokale Einstellung, die Ollamas Cloudfunktionen deaktiviert, sowie Einstellungen, die den Server in einem Netzwerk freigeben können. Ollama

LocalAI beschreibt lokal ausgeführte Agenten, die mit externen Diensten interagieren können. Es dokumentiert auch agentenspezifische Einstellungen für einen externen Modellanbieter. LocalAI Diese Beispiele zeigen, warum „der Agent läuft auf unserer Box“ noch nicht erklärt, wohin jede Anfrage geht.

Die Datenschutzprüfung muss der tatsächlichen Grenze folgen:

  • Modellmodus und Endpunkte prüfen. Erfassen Sie, ob jede Modellanfrage auf der Box bleibt oder einen externen Anbieter erreicht. Ollama unterscheidet lokale Nutzung und cloudgehostete Modelle. Ollama

  • Werkzeuge und Konnektoren prüfen. Ein lokal ausgeführter Agent kann über seine erlaubten Aktionen externe Dienste aufrufen. LocalAI dokumentiert API-Aufrufe und externe Konnektoren als Agentenfunktionen. LocalAI

  • Netzwerkfreigabe prüfen. Ollama bindet standardmäßig an eine lokale Adresse und dokumentiert, wie diese Adresse geändert oder über einen Proxy freigegeben werden kann. Ollama

  • Gespeicherten Zustand und Zugriff prüfen. LocalAI dokumentiert persistenten Agentenzustand und die Speicherung einer Wissensbasis. LocalAI Außerdem dokumentiert es Authentifizierung, Rollen und Einblick in die Nutzung. LocalAI

Ersetzen Sie diese Prüfung nicht durch eine Sicherheitsgarantie. Eine lokale Bereitstellung ist eine Architekturentscheidung, die bestimmte Kontrollen in die Hände des Betreibers legt. Danach muss das Unternehmen festlegen, wie diese Kontrollen eingerichtet und geprüft werden. Der Leitfaden zu Sicherheit und Governance beschreibt den nächsten internen Schritt.

Was sollte ein Beratungsunternehmen kaufen: lokal, hybrid oder verwaltet?

Verwaltetes SaaS ist die einfachere Betriebsentscheidung, wenn das Unternehmen die Box und ihre Laufzeitaufgaben nicht selbst verantworten möchte. Das ist eine Managemententscheidung und keine Aussage, dass eine Architektur für jede Arbeitslast passt.

Wählen Sie den verwalteten Weg, wenn das gewünschte Ergebnis klar ist, aber niemand im Unternehmen Updates, Protokolle, Zugriff, Kapazitätsentscheidungen oder Servereinstellungen übernehmen wird. Wählen Sie einen lokalen Weg oder eine private Box, wenn die Grenze selbst wichtig ist und das Unternehmen die benannte Betreiberrolle akzeptiert. Wenn das Team die Modellzugangsdaten kontrollieren, den Dienst aber gehostet nutzen möchte, behandeln Sie den BYOK-Leitfaden als separate Option.

Entscheidend ist nicht, ob lokale Agenten modern oder technisch möglich sind. Entscheidend ist, ob das Unternehmen die Verantwortung übernehmen will, die mit dieser Grenze einhergeht. Ein lokales Modell kann den Ort der Inferenz ändern. Lokale Orchestrierung kann den Ort von Agentenzustand und Werkzeugrichtlinien ändern. Eine private Box kann ändern, wer den Host kontrolliert. Keine dieser Entscheidungen benennt automatisch einen Betreiber.

Nutzen Sie diese kurze Entscheidungsfolge:

  1. Benennen Sie die Arbeitslast und ihre Abnahmeprüfungen.
  2. Ordnen Sie Modell, Orchestrierung, Speicher, Werkzeuge und externe Verbindungen zu.
  3. Weisen Sie Hardware und Betriebsverantwortung zu.
  4. Prüfen Sie Datenschutz- und Netzwerkeinstellungen an der tatsächlichen Konfiguration.
  5. Vergleichen Sie dieses Verantwortungsmodell mit einem verwalteten Dienst.

Wenn die lokale Grenze zum gewünschten Ergebnis gehört und ein Verantwortlicher benannt ist, setzen Sie die Bewertung einer privaten Box fort. Wenn niemand die Betriebsaufgaben übernimmt, wählen Sie einen verwalteten Weg oder verkleinern Sie den lokalen Umfang. Der Leitfaden „Box oder SaaS“ unterstützt den Vergleich.

Ist ein lokales Modell dasselbe wie ein lokaler Agent?

Nein. Ein lokales Modell führt die Inferenz auf lokaler Hardware aus. Zu einem Agenten gehört außerdem die Logik für Ziele, Werkzeugaufrufe, Zustand und Ergebnisse. Das Modell erzeugt eine strukturierte Werkzeuganfrage, und der Anwendungscode führt die Funktion aus.

Der freeCodeCamp-Leitfaden dokumentiert diesen Ablauf eines Werkzeugaufrufs. freeCodeCamp

Beseitigt eine private Box den Wartungsaufwand?

Nein. Für Laufzeitumgebung und Host wird weiterhin ein Verantwortlicher benötigt. Dazu gehören Updates, Protokolle, Speicher, Warteschlangen, Hardwareeinstellungen, Steuerungsmöglichkeiten des Teamservers und Einblick in die Nutzung.

Ollama dokumentiert die Aufgaben für Laufzeitumgebung und Host. Ollama LocalAI dokumentiert Teamserver-Kontrollen und Einblick in die Nutzung. LocalAI

Vermeiden lokale Agenten alle externen Verbindungen?

Nicht standardmäßig. Lokal ausgeführte Agenten können mit externen Diensten interagieren und einen externen Modellanbieter nutzen. Die Bereitstellungsprüfung muss die tatsächlich aktivierten Werkzeuge, Konnektoren und Modellendpunkte aufführen.

LocalAI dokumentiert beide Arten externer Verbindungen. LocalAI

Wie sollte ein kleines Beratungsunternehmen die Entscheidung beginnen?

Beginnen Sie mit einer schriftlich beschriebenen Arbeitslast, ihren erlaubten Werkzeugen und einem Abnahmetest. Ordnen Sie danach zu, welche Teile auf kontrollierter Hardware laufen, und benennen Sie den Betreiber. Die Bereitschaftstabelle hilft bei der Eingrenzung, verspricht aber nicht, dass eine bestimmte Box oder ein bestimmtes Modell zu einer ungetesteten Arbeitslast passt.

Möchten Sie den Weg mit privater Box prüfen? Öffnen Sie das AI Jungle OS Cockpit.

Geschrieben von Tileo, der ein Portfolio von Internetunternehmen aus demselben Cockpit betreibt.