Ist WebBrain eine kostenlose Alternative zu Claudes Browser-Plugin?
Ja. WebBrain bietet ähnliche AI-Browser-Agent-Funktionen — Seiten lesen, Daten extrahieren, Buttons klicken, Formulare ausfüllen und mehrstufige Workflows automatisieren. Im Gegensatz zu Claudes proprietärem Browser-Plugin, das ein Claude Pro-Abonnement erfordert und nur mit Anthropic-Modellen funktioniert, ist WebBrain komplett kostenlos, Open Source (MIT-Lizenz) und unterstützt mehrere LLM-Anbieter, einschließlich lokaler Modelle, die vollständig auf Ihrem Computer laufen.
Was kostet ein WebBrain-Cloud-Abonnement?
WebBrain Cloud kostet derzeit $5/Monat pro Geräteprofil, deutlich günstiger als Claude Pro. Die Nutzung ist derzeit unter einer Fair-Use-Richtlinie unbegrenzt: normaler privater Gebrauch ist erlaubt, aber Missbrauch, automatisierte Nutzung, Weiterverkauf oder ungewöhnlich hohe Volumen sind nicht gestattet.
Das Abonnement ist an die von der Erweiterung für diese Browser + OS-GUID generierte Geräte-ID geknüpft, nicht an ein Benutzerkonto. Wenn diese ID verloren geht, weil Sie den Erweiterungsspeicher zurücksetzen, das Browserprofil löschen, den Browser neu installieren, den Browser/das Betriebssystem wechseln oder das Gerät verlieren, können wir sie nicht abrufen oder übertragen, und wir erstatten diesen Verlust nicht.
Sie können sich abonnieren oder die Abrechnung über den Account-Bereich der Plugin-Einstellungsseite mit der Schaltfläche Abrechnung verwalten kündigen. Um manuell zu kündigen, kontaktieren Sie uns per E-Mail mit der E-Mail-Adresse, die Sie beim Checkout verwendet haben.
Wie funktioniert die verschlüsselte Cloud-Synchronisation?
Cloud Sync ist eine optionale Funktion für aktive WebBrain-Cloud-Abonnenten. Es synchronisiert Ihre WebBrain-Gedächtnisse, Profil-Autoausfülltext und unterstützte Anbieterkonfiguration, einschließlich API-Schlüssel. Es synchronisiert nicht die Chat-Historie, Browserverlauf, Seiten-Screenshots oder veraltete OAuth-Access- und Refresh-Tokens.
Ihr Browser verschlüsselt den Synchronisationsspeicher vor dem Upload mit einem Passwort Ihrer Wahl. WebBrain Cloud speichert nur den verschlüsselten Speicher; es kann Ihre Gedächtnisse, Profiltext, Anbieter-Einstellungen oder API-Schlüssel nicht lesen und kann das Synchronisationspasswort nicht für Sie wiederherstellen.
Das E-Mail-Feld dient der WebBrain-Cloud-Magic-Link-Abrechnungs-/Abonnements-Authentifizierung. Es ist kein Kontopasswort. Wenn die Benutzeroberfläche "Passwort in Cloud Sync ändern" anzeigt, ist damit das Synchronisations-Verschlüsselungspasswort gemeint, kein WebBrain-Kontopasswort.
Wenn Sie das Synchronisationspasswort vergessen, kann der alte verschlüsselte Cloud-Speicher nicht entschlüsselt werden. Sie können den Cloud-Speicher zurücksetzen und eine neue verschlüsselte Kopie von einem Gerät hochladen, das die Daten noch lokal hat.
Wie verhält sich WebBrain zu OpenClaw, Browser-Use und anderen AI-Agent-Frameworks?
Es sind verschiedene Kategorien von Tools. WebBrain ist eine Browser-Erweiterung — Sie installieren sie in Chrome oder Firefox und chatten in einer Seitenleiste, ohne zu programmieren. Frameworks wie OpenClaw und Browser-Use sind Entwickler-SDKs zum Bauen automatisierter Browser-Pipelines in Python, in der Regel mit Headless-Browsern und CDP. Denken Sie so: WebBrain ist für das tägliche Browsen mit einem KI-Assistenten; Agent-Frameworks sind zum Bauen von Scraping-Bots und Testautomatisierung. Sie können beide nutzen — sie ergänzen sich.
Kann ich WebBrain komplett offline nutzen?
Ja. Der Standardanbieter von WebBrain ist llama.cpp, das ein lokales KI-Modell auf Ihrem Computer ausführt. Keine API-Schlüssel nötig, kein Internet für die KI erforderlich, und Daten verlassen nie Ihre Maschine. Laden Sie einfach ein GGUF-Modell herunter, starten Sie llama-server und Sie haben einen vollständig privaten AI-Browser-Agent. Sie können auch Ollama mit dessen OpenAI-kompatiblem Endpoint verwenden.
Welche KI-Modelle unterstützt WebBrain?
WebBrain unterstützt vier Anbieter-Typen: llama.cpp (jedes lokale GGUF-Modell), OpenAI (GPT-4o, GPT-4 usw.), Claude (Claude Opus, Sonnet, Haiku über die native API) und OpenRouter (Zugang zu 100+ Modellen verschiedener Anbieter). Jeder OpenAI-kompatible API-Endpoint funktioniert, sodass Sie auch Dienste wie Together AI, Groq, Mistral oder jeden lokalen Server mit einer OpenAI-kompatiblen Oberfläche verwenden können.
Welches ist das empfohlenste Modell?
Stand 21. April 2026 ist die Top-Empfehlung Qwen 3.6 35B. Warum: In unserem Vision-Benchmark (vision-model-shootout) schlug es Gemma 4 beim Screenshot-Verständnis, während es für lokale Inferenz praktikabel blieb.
Für Verbraucher-GPUs ist die RTX 5090 ideal, und die RTX 4090 ist oft mit INT4 AutoRound-Quantisierung über Intel/Qwen3.6-35B-A3B-int4-AutoRound nutzbar.
Für maximale Geschwindigkeit empfehlen wir vLLM. Beispielbefehl:
python -u -m vllm.entrypoints.openai.api_server --model Intel/Qwen3.6-35B-A3B-int4-AutoRound --served-model-name qwen3.6-35b --quantization auto --dtype bfloat16 --max-model-len 65536 --max-num-batched-tokens 32768 --max-num-seqs 4 --host 0.0.0.0 --port 8000 --gpu-memory-utilization 0.92 --enable-prefix-caching --enable-chunked-prefill --limit-mm-per-prompt '{"image": 4, "video": 1}' --mm-processor-cache-type shm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --trust-remote-code --allowed-origins '["*"]' --speculative-config '{"method": "dflash", "model": "z-lab/Qwen3.6-35B-A3B-DFlash", "num_speculative_tokens": 15}' --attention-backend flash_attn
DFlash-speculatives Decodieren ist optional.
Ich erhalte "Failed to fetch" beim Verbinden mit einem lokalen LLM-Server (vLLM, Ollama, llama.cpp) in meinem Netzwerk
Wenn Ihr LLM-Server auf einer anderen Maschine in Ihrem lokalen Netzwerk läuft (z.B. http://192.168.1.x:8000), blockiert Chrome die Anfrage, es sei denn, der Server sendet CORS-Header. Die Lösung hängt von Ihrem Server ab:
vLLM: Starten Sie mit --allowed-origins '["*"]' (der Wert muss eine JSON-Liste sein).
Ollama: Setzen Sie die Umgebungsvariable OLLAMA_ORIGINS=* vor dem Start.
llama.cpp: CORS ist standardmäßig aktiviert — keine Änderungen nötig.
Wenn Ihr Server auf localhost läuft (dieselbe Maschine wie der Browser), ist CORS normalerweise nicht erforderlich. Das Problem betrifft nur maschinenübergreifende Verbindungen im lokalen Netzwerk. Stellen Sie sicher, dass Ihre Basis-URL in den WebBrain-Einstellungen auf /v1 endet (z.B. http://192.168.1.47:8000/v1). Ausnahme: Ollama, das aus einer Browser-Erweiterung verwendet wird, benötigt möglicherweise noch OLLAMA_ORIGINS; siehe die Ollama-FAQ unten.
Warum gibt Ollama auf localhost 403 aus der WebBrain-Erweiterung zurück?
Aktuelle Ollama-Versionen können Anfragen von Browser-Erweiterungs-Origins ablehnen, selbst wenn Ollama auf derselben Maschine läuft. Die Erweiterung sendet einen Origin wie chrome-extension://... oder moz-extension://..., und Ollama kann mit 403 antworten, wenn diese Origins nicht erlaubt sind.
Beenden Sie jede Ollama-Desktop-App, die bereits Port 11434 belegt, und starten Sie Ollama mit einem dieser Befehle:
OLLAMA_ORIGINS="*" ollama serve
OLLAMA_ORIGINS="chrome-extension://*,moz-extension://*" ollama serve
Halten Sie WebBrains Ollama-Basis-URL auf http://localhost:11434/v1 eingestellt. Terminal-curl-Checks können weiterhin ohne diese Einstellung funktionieren, da sie keinen Browser-Erweiterungs-Origin senden.
Funktioniert WebBrain auf Firefox?
Ja. WebBrain wird sowohl mit einer Chrome-Version (Manifest V3, über die sidePanel-API) als auch mit einer Firefox-Version (Manifest V2, über sidebar_action) ausgeliefert. Beide Versionen haben identische Funktionen. Die Firefox-Version kann als temporäres Add-on für die Entwicklung geladen oder auf addons.mozilla.org für die dauerhafte Installation veröffentlicht werden.
Kann ich die Firefox-Seitenleiste von links nach rechts verschieben, wie Chores Side Panel?
Ja — die Firefox-Seitenleiste ist standardmäßig links, aber Sie können sie umschalten. Klicken Sie mit der rechten Maustaste irgendwo in den Seitenleisten-Header und wählen Sie Seitenleiste nach rechts verschieben (oder verwenden Sie Ansicht → Seitenleiste → Seitenleiste nach rechts verschieben aus der Menüleiste). Die Position bleibt über Neustarts hinweg erhalten. Chores Side Panel ist standardmäßig rechts und kann vom Benutzer nicht aus dem Panel selbst verschoben werden.
Gibt es Einschränkungen bei der Verwendung von WebBrain in Vivaldis Web Panel?
Ja. Vivaldi-Web-Panels unterdrücken native JavaScript-Dialoge wie confirm(), alert() und prompt(). WebBrains Fragen-, Handeln- und Dev-Modus-Schalter hängt nicht mehr von diesen Dialogen ab, aber einige untergeordnete Aktionen schon.
Neues Gespräch: Im Web Panel scheint der Button nichts zu tun, weil sein Bestätigungsdialog unterdrückt wird. Rechtsklicken Sie auf das WebBrain-Panel-Symbol, wählen Öffnen in → Neuer Tab, und verwenden Sie Neues Gespräch aus diesem normalen Tab.
Aufzeichnung: Verwenden Sie /record vorerst nicht in Vivaldi. Wenn die Aufzeichnung fehlschlägt, kann Vivaldi die Fehlermeldung verbergen und keine sichtbare Erklärung hinterlassen.
Einstellungen, Verlauf, Traces und Ollama-Übergabe: Diese enthalten ebenfalls native Dialoge, aber WebBrain öffnet sie normalerweise als reguläre Tabs, wo sie funktionieren. Wenn Sie eines manuell in ein Web Panel verschieben, öffnen Sie es in einem normalen Tab, bevor Sie dialogabhängige Aktionen verwenden.
Ist WebBrain sicher? Kann es Webseiten ändern?
WebBrain hat drei Modi. Fragen-Modus (Standard) ist schreibgeschützt und kann nichts auf der Seite ändern. Handeln-Modus ermöglicht Browser-Aktionen wie Klicken, Tippen und Navigieren, während der Dev-Modus Seitendepug-Tools hinzufügt. Folgenreiche Aktionen erfordern standardmäßig eine Genehmigung; wenn diese Genehmigungssperre deaktiviert ist, zeigt WebBrain ein sichtbares Warnbanner an. Sie können den Agenten jederzeit mit der Stopp-Taste anhalten. Der Quellcode der Erweiterung ist auf GitHub vollständig zur Prüfung einsehbar.
Was ist das "WebBrain started debugging this browser"-Banner? Warum verwendet WebBrain CDP?
Um zuverlässig auf einer Seite zu handeln, verwendet WebBrain das Chrome DevTools Protocol (CDP) über die Standard-chrome.debugger-Erweiterungs-API — das ist, was Chores "WebBrain started debugging this browser"-Banner auslöst. CDP ermöglicht es dem Agenten, mit vertrauenswürdigen Eingabeereignissen zu klicken und zu tippen, die moderne Seiten tatsächlich annehmen; synthetische Ereignisse, die von einem Content-Script ausgelöst werden, werden von vielen Seiten, Web Components und framework-kontrollierten Feldern abgelehnt. Es ist auch der Weg, wie WebBrain pixelgenaue Screenshots für den Vision-Fallback erfasst und Zugriff auf cross-origin-iframes und Shadow DOM erhält, die Content-Scripts nicht sehen können.
Schreibgeschützter Fragen-Modus benötigt kein CDP — Seiten- und Barrierefreiheitsbaum-Lesungen laufen über gewöhnliche Content-Scripts. Es sind die Handeln-Modus-Zuverlässigkeit und die Cross-Origin-Arbeit, die es erfordern, und in einer Manifest-V3-Erweiterung gibt es keine Non-Debugging-API für vertrauenswürdige Eingabe. WebBrain hängt den Debugger nur dann an, wenn eine Aktion es benötigt, pro Tab, und die gesamte Erweiterung ist Open Source, sod Sie genau prüfen können, was die Sitzung macht. CDP ist mächtig, daher behandeln wir seinen Fußabdruck als etwas einzugrenzen — auf Nachfrage anhängen, Lesungen davon fernhalten — und das weiter einzuschränken steht auf unserer Sicherheitsroadmap.
Es stellt zu viele Fragen. Kann ich das deaktivieren?
Diese Genehmigungsanfragen dienen Ihrer Sicherheit. Selbst auf vertrauenswürdigen Seiten können böswillige Akteure LLM-Anweisungen nachahmen oder Inhalt injizieren, der den Agenten dazu bringt, in Ihrem Namen Dinge zu tun, die Sie nicht genehmigen würden. Deshalb fragt WebBrain vor folgenreichen Aktionen nach. Wenn Sie diese Aufforderungen dennoch nicht durchlaufen möchten, geben Sie /dangerously-skip-permissions in der Seitenleiste ein, oder öffnen Sie das Seitenplugin, klicken auf das Zahnradsymbol im Header, gehen zum Permissions-Tab in settings.html und schalten Ask before consequential actions aus.
Wie nutze ich WebBrain für Web-Scraping und Datenextraktion?
Öffnen Sie einfach eine beliebige Webseite, öffnen Sie die WebBrain-Seitenleiste und fragen Sie in natürlicher Sprache: "Extrahiere alle Produktnamen und Preise von dieser Seite", "Hole alle E-Mail-Adressen auf dieser Seite" oder "Fasse diesen Artikel in Stichpunkten zusammen". Der KI-Agent liest den Seiteninhalt, versteht die Struktur und gibt die extrahierten Daten zurück. Für komplexeres Scraping wechseln Sie in den Handeln-Modus und der Agent kann zwischen Seiten navigieren, Pagination-Buttons klicken und Daten über mehrere Seiten aggregieren.
Ruft WebBrain APIs direkt auf oder klickt es immer durch die Benutzeroberfläche?
Standardmäßig geht WebBrain immer durch die sichtbare Benutzeroberfläche für jede Aktion, die etwas erstellt, ändern, löscht, sendet, übermittelt, posted oder kauft. Es navigiert zur Seite, füllt das Formular aus und klickt auf den Button — genau wie Sie es tun würden. Es weigert sich, REST/GraphQL-Endpunkte direkt über Hintergrund-fetch() für Mutationen aufzurufen. Das ist beabsichtigt: API-Aktionen sind unsichtbar (Sie sehen nicht, was gesendet wird), erfordern oft separate Authentifizierungstokens, die Sie möglicherweise nicht konfiguriert haben, und haben einen viel größeren Wirkungsbereich als ein sichtbarer Fehlklick. UI-zuerst bedeutet, dass alles auf dem Bildschirm ist, in Ihrer normalen Browsersitzung, und anhalbar.
Für das Lesen von Daten — ein README abrufen, ein Issue nachschlagen, Preise zwischen Seiten vergleichen, eine Statusseite prüfen — verwendet WebBrain frei Hintergrund-HTTP-Anfragen über die fetch_url- und research_url-Tools. Lesen ist nicht dasselbe wie Handeln; es ändert nichts auf einem Remote-Dienst, daher sind die Sicherheitsbedenken nicht anwendbar.
Wenn Sie speziell API-Mutationen für eine bestimmte Aufgabe erlauben möchten, geben Sie /allow-api am Anfang Ihrer Nachricht ein (optional gefolgt von einer kurzen Aufgabenbeschreibung). Diese gesprächsweise Ausnahme lässt WebBrain auf API-Endpunkte zurückgreifen, wenn die UI tatsächlich fehlschlägt, während es die UI bevorzugt, wenn sie funktioniert. Ein haftender Badge bleibt über dem Eingabebereich sichtbar, solange die Ausnahme aktiv ist, und verschwindet, wenn Sie das Gespräch zurücksetzen.
Kann ich es auch in LM Studio verwenden?
Ja. WebBrains schreibgeschützte Netzwerktools — fetch_url und research_url — werden auch als eigenständiges LM Studio-Plugin auf webbrain/web-tools veröffentlicht. Installieren Sie mit lms clone webbrain/web-tools und aktivieren Sie es in jedem LM Studio-Chat — jedes toolfähige Modell kann dann diese beiden Tools aufrufen, ohne dass Sie die Browser-Erweiterung installieren. Rein Node, kein Headless-Browser. Quelle: lmstudio-plugin/.
Kann ich zu einem anderen Tab wechseln, während WebBrain an einer Seite arbeitet?
Ja, auf Chrome — der Agent läuft im Hintergrund-Service Worker und ist an den Tab gebunden, auf dem er gestartet wurde, daher klickt, tipft und liest er diesen bestimmten Tab weiterhin, selbst wenn Sie den Fokus woanders hin verschieben. Tools, die einen Tab ansprechen (CDP Klick, Tippen, Navigation, Screenshot), funktionieren alle auf im Hintergrund befindlichen Tabs in Chrome. Die Seitenleiste sperrt die Eingabe, solange eine Aufgabe läuft, damit Sie nicht versehentlich eine zweite Aufgabe auf dem neuen Tab starten — Sie müssen warten oder die aktuelle stoppen. Beachten Sie, dass Browser Timer und Animationen auf Hintergrund-Tabs drosseln, daher können stark animierte Seiten etwas langsamer reagieren.
Auf Firefox läuft der Agent ebenfalls weiterhin auf seinem ursprünglichen Tab, aber automatische Screenshots sind eingeschränkt: Firefox' Screenshot-API kann nur den aktiven Tab erfassen, nicht einen bestimmten Tab im Hintergrund. WebBrain erkennt das und überspringt den Screenshot für diesen Durchgang, anstatt dem Modell ein Bild einer irrelevanten Seite zu füttern. Der Agent plant weiterhin auf Basis von textbasiertem Kontext, bis Sie zu seinem Tab zurückkehren.
Vermeiden Sie aktives Klicken oder Tippen auf demselben Tab, an dem der Agent arbeitet — das erzeugt Race Conditions, bei denen Sie und der Agent um dieselbe Seite konkurrieren. Tab-Wechsel ist in Ordnung; gemeinsam denselben Tab steuern ist es nicht.
Wie funktioniert die Profil-Autoausfüllung und ist sie sicher?
Die Profil-Autoausfüllung ist eine optionale Funktion unter Einstellungen → Profil. Sie geben eine kurze Biografie ein — Name, Arbeits-E-Mail, Unternehmen und ein Wegwerf-Passwort für unkomplizierte Anmeldungen — und aktivieren sie. Wenn aktiviert, fügt WebBrain diesen Text dem System-Prompt des Agenten hinzu, damit er Anmeldeformulare ausfüllen kann, ohne jedes Mal zu fragen.
Der Text wird in Klartext im lokalen Speicher Ihres Browsers gespeichert. Er wird nicht an das WebBrain-Projekt übertragen, aber er wird an jeden LLM-Anbieter, den Sie konfiguriert haben, bei jedem Durchgang als Teil des System-Prompts gesendet. Standardmäßig deaktiviert.
Geben Sie hier keine Passwörter für wichtige Konten ein (Google, Apple, iCloud, Banken, Arbeits-SSO, Haupt-E-Mail). Diese Konten sollten Zwei-Faktor-Authentifizierung verwenden und sollten ohnehin nicht an einen Agenten übergeben werden. Ein Wegwerfpasswort, das Sie für Newsletter-Anmeldungen und kostenlose Testversionen wiederverwenden, ist der vorgesehene Anwendungsfall.
Garantiert die Screenshot-Retuschiereinstellung, dass meine Privatdaten nie ein Cloud-Vision-Modell erreichen?
Nein — es reduziert die Exposition, es ist keine Garantie. Wenn aktiviert (Einstellungen → Multimodal → Screenshot-Retuschiereinstellung, standardmäßig deaktiviert), pixelt WebBrain Formularfelder und Text, der wie eine E-Mail-Adresse oder Telefonnummer aussieht, auf jedem Screenshot bevor es an ein Vision-Modell gesendet wird. Die Erkennung läuft vollständig auf Ihrem Gerät über DOM-Heuristiken; es wird nichts Zusätzliches übertragen.
Es ist ein Best-Effort-Ansatz mit Fail-Open. Wenn der Erkennungsdienst nicht auf einer Seite laufen kann — beispielsweise direkt nach einer Navigation, auf PDF-Betrachtern oder auf eingeschränkten Browserseiten — wird das Screenshot trotzdem unretuschiert gesendet, anstatt Ihre Aufgabe abzubrechen. Inhalte, die die DOM-Heuristiken nicht sehen können (auf einem Canvas gezeichneter Text, PII in Bildern, ungewöhnliche Widgets), können ebenfalls durchschlüpfen. Und die Einstellung betrifft nur Screenshots: Seitentext, der an das Modell gesendet wird, wird nicht retuschiert.
Für vollständige Vision-Privatsphäre verwenden Sie ein lokales Modell. Mit einem Offline-Anbieter wie llama.cpp oder Ollama verlassen Screenshots und Seitentext Ihre Maschine nie, daher gibt es nichts zu retuschieren — das ist die einzige Konfiguration, bei der Privatsphäre garantiert ist. Siehe "Kann ich WebBrain komplett offline nutzen?" oben.
Keine Maschine, die ein visionfähiges lokales Modell betreiben kann? Ein guter Kompromiss ist ein kleines lokales Modell für Planung und Tool-Aufrufe (schnell und leicht genug für eine bescheidene CPU/GPU) gekoppelt mit einem Cloud-Anbieter für die Vision-Unteraufrufe, mit aktivierter Screenshot-Retuschiereinstellung. Sie behalten Ihr Gespräch und Seitentext auf dem Gerät, und jeder Screenshot, der zur Cloud-Vision geht, hat zuerst formularfelder und erkannte E-Mails/Telefonnummern verwischt — reduzierte Cloud-Exposition ohne Hardware für ein vollständiges lokales Vision-Modell. Konfigurieren Sie die Vision-Aufteilung unter Einstellungen → Vision (siehe "Wie hält WebBrain Cloud-LLM-Rechnungen unter Kontrolle?" oben).
Was macht WebBrain mit Cookie-Bannern und Paywalls?
Cookie-Banner: WebBrain erkennt Einwilligungsbanner gängiger Frameworks (OneTrust, Cookiebot, Didomi, Quantcast, Google Funding Choices, TrustArc) und entfernt sie, bevor die Seite analysiert wird. Vorrang hat "Alle ablehnen" / "Nicht-Essenzielle ablehnen" / "Nur Notwendige", wenn klar sichtbar; es greift auf "Alle akzeptieren" zurück, anstatt im "Vorlieben verwalten"-Labyrinth zu verschwinden.
Paywalls: WebBrain meldet die Paywall ehrlich und sagt Ihnen, was es tatsächlich sehen konnte (Überschrift, Einleitung, erste Absätze). Es versucht nicht, Paywalls zu umgehen — kein archive.today, kein 12ft.io, kein Cookie-Löschen, kein JS-Deaktivieren oder Lesemodus-Tricks. Wenn Sie den vollständigen Artikel möchten, melden Sie sich mit einem Abonnement an oder bitten Sie WebBrain, kostenlose Berichterstattung über dieselbe Geschichte zu suchen.
Unterstützt WebBrain einen Dry-Run-Modus?
Ab Version 7.0.0, noch nicht. Der Dry-Run-Modus ist geplant und bereits auf der Roadmap.
Wie hält WebBrain Cloud-LLM-Rechnungen unter Kontrolle?
Drei unabhängige Schichten:
Token-bewachte Screenshots. Bevor ein Bild Ihre Maschine verlässt, skaliert WebBrain es herunter (kurze Seite begrenzt, Seitenverhältnis beibehalten) und komprimiert es iterativ JPEG, bis es in ein pro-Durchgang Bild-Token-Budget passt. Ein 2000×1200-Screenshot, das Sie ~1.500 Eingabe-Tokens auf GPT-4o kosten würde, wird auf ~300–500 Tokens komprimiert, ohne praktische Einbußen für Seitenlese-Aufgaben. Implementiert in _fitImageDimensions mit Unit-Tests für die Budget-Berechnung.
Intelligentes Kontext-Kürzen. Gesprächshistorie, Tool-Ausgaben und Inline-DOM-Dumps werden pro Durchgang begrenzt und vom ältesten zum neuesten gekürzt, wenn das Kontextfenster des aktiven Modells sich dem Maximum nähert. Sie werden nicht sehen, dass eine Sitzung lautlos von 10k auf 100k Tokens anschwillt, weil ein read_page einen romanlangen Artikel zurückgab.
Dediziertes Vision-Modell. Koppeln Sie ein billiges Textmodell (z.B. GPT-4o-mini) für Planung und Tool-Aufrufe mit einem separaten visionfähigen Modell (z.B. GPT-4o) nur für Screenshots, damit Sie nicht den Multimodal-Modell-Tarif bei jedem einzelnen Durchgang bezahlen. Konfigurieren Sie unter Einstellungen → Vision.
Netto-Ergebnis: Lange Sitzungen mit Cloud-Anbietern bleiben vorhersehbar. Für vollständige Kontrolle verwenden Sie llama.cpp lokal — keine Kosten pro Token.
Kann ich zu WebBrain beitragen?
Selbstverständlich! WebBrain steht unter der MIT-Lizenz und begrüßt Beiträge. Schauen Sie im GitHub-Repository nach Issues, Feature-Requests und Beitrittsrichtlinien vorbei.