AI nguồn mở Đại lý trình duyệt

WebBrain là một tiện ích mở rộng trình duyệt mã nguồn mở miễn phí mang lại khả năng tác nhân AI cho trình duyệt của bạn. Đọc trang, trích xuất dữ liệu và tự động hóa các tác vụ trên web — được hỗ trợ bởi sự lựa chọn LLM của bạn. Giải pháp thay thế tự lưu trữ cho các plugin AI của trình duyệt độc quyền.

Cài đặt tiện ích mở rộng Xem trên GitHub
https://magazine.dev/local-ai-2026

Tương lai của AI địa phương

Bởi Jane Smith · 8 phút đọc
WebBrain.one
Tóm tắt bài viết này
LLM cục bộ hiện phù hợp với chất lượng đám mây trong nhiều tác vụ — được thúc đẩy bởi lượng tử hóa tốt hơn, GPU tiêu dùng nhanh hơn và sự thay đổi ưu tiên quyền riêng tư.
Tác giả dự đoán gì cho năm 2026?
Nhắc lại ngữ cảnh bài viết
Bởi 2026, tác giả kỳ vọng hơn 70% khối lượng công việc AI của người tiêu dùng sẽ chạy trên thiết bị.
Hỏi bất cứ điều gì về trang này...
Bản trình diễn

Xem WebBrain hoạt động

Xem cách WebBrain đọc trang, trích xuất dữ liệu và tự động hóa các tác vụ của trình duyệt.

Tính năng

Mọi thứ bạn cần trong một trình duyệt AI

Một tác nhân AI đầy đủ tính năng nằm trong thanh bên trình duyệt của bạn và hiểu bất kỳ trang web nào.

📖

Hiểu trang

Đọc và hiểu bất kỳ trang web nào — bài viết, tài liệu, trang tổng quan, biểu mẫu. Đặt câu hỏi và nhận câu trả lời ngay lập tức từ nội dung trang hiện tại.

🤖

Đại lý trình duyệt đầy đủ

Nhấp, nhập, cuộn, điều hướng và tương tác với các trang thay mặt bạn. Tự động hóa các tác vụ lặp đi lặp lại bằng hướng dẫn bằng ngôn ngữ tự nhiên.

📊

Khai thác dữ liệu

Trích xuất dữ liệu có cấu trúc từ bất kỳ trang nào - bảng, danh sách, liên kết, biểu mẫu. Xuất danh mục sản phẩm, kết quả tìm kiếm hoặc bất kỳ nội dung trang nào. Hoạt động với các tệp PDF.

🔌

LLM đa nhà cung cấp

Hoạt động với llama.cpp, OpenAI, Claude và OpenRouter cục bộ. Sử dụng mô hình ưa thích của bạn — hoặc chạy hoàn toàn ngoại tuyến với AI cục bộ.

🛡️

Quyền riêng tư đầu tiên

Dữ liệu của bạn vẫn là của bạn. Chạy với LLM cục bộ để tránh rò rỉ dữ liệu. Không cần đo từ xa, không theo dõi, không cần tài khoản. Nguồn mở hoàn toàn.

Bối cảnh thông minh

Quản lý bối cảnh tự động ngăn chặn tình trạng tràn mã thông báo. Cắt bớt lịch sử hội thoại một cách thông minh và giới hạn đầu ra của công cụ để đảm bảo các phiên diễn ra suôn sẻ, không bị gián đoạn.

👁️

Mô hình tầm nhìn chuyên dụng

Ghép nối mô hình nhanh chỉ có văn bản để lập kế hoạch với một mô hình có khả năng nhìn riêng biệt để đọc ảnh chụp màn hình. Rẻ hơn và nhanh hơn so với việc sử dụng một mô hình đa phương thức lớn duy nhất cho mọi thứ.

👤

Tự động điền hồ sơ

Tiểu sử văn bản gốc tùy chọn — tên, email công việc, công ty, mật khẩu dùng một lần — cho phép đại lý lướt qua các biểu mẫu đăng ký chi phí thấp mà không cần hỏi mọi lúc. Tắt theo mặc định, tất cả được lưu trữ cục bộ.

🍪

Nhận biết cookie và tường phí

Loại bỏ các biểu ngữ chấp thuận (OneTrust, Cookiebot, Didomi, Quantcast) trước khi đưa ra lý do về trang. Phát hiện các bức tường phí và thông báo cho bạn một cách trung thực thay vì bịa đặt nội dung bài viết hoặc cố gắng vượt qua chúng.

🧩

Bộ giải CAPTCHA tùy chọn

Cắm vào một CapSolver Khóa API và tác nhân sẽ tự động giải quyết reCAPTCHA v2/v3, hCaptcha và Cloudflare Turnstile khi họ chặn một bước — thay vì dừng lại để hỏi. Theo mặc định, khóa BYO bị tắt, không có dịch vụ xác thực nào được gửi hoặc liên hệ trừ khi bạn bật nó.

🌐

Giao diện người dùng đa ngôn ngữ

Plugin này có sẵn bằng tiếng Anh, Español, Français, Türkçe và 中文. Tự động phát hiện ngôn ngữ trình duyệt của bạn trong lần sử dụng đầu tiên; chuyển đổi bất cứ lúc nào từ biểu tượng quả địa cầu ở bảng điều khiển bên cạnh. Trang web tiếp thị được bản địa hóa để phù hợp.

💰

Ý thức về mã thông báo

Ảnh chụp màn hình được thay đổi kích thước và nén JPEG lặp đi lặp lại trước khi chúng rời khỏi máy của bạn, giữ cho mã thông báo hình ảnh ở mức nhỏ. Việc cắt xén bối cảnh thông minh và giới hạn đầu ra công cụ giúp có thể dự đoán được hóa đơn trên đám mây — không phải chi tiêu bất ngờ cho các phiên dài.

Bảo mật

WebBrain giúp bạn kiểm soát như thế nào

Trình duyệt là nơi công việc thực sự diễn ra — và là một bề mặt đối nghịch. WebBrain bắt đầu ở Chế độ hỏi chỉ đọc, hỏi trước khi hành động, bảo vệ khỏi các nội dung nhắc nhở ẩn và xử lý các trường nhạy cảm bằng các quy tắc chặt chẽ hơn.

Nhà cung cấp LLM

Mang theo AI của riêng bạn

Kết nối với bất kỳ API tương thích OpenAI nào hoặc chạy mô hình cục bộ. Chuyển đổi nhà cung cấp bất kỳ lúc nào từ cài đặt tiện ích mở rộng. Đối với các kiểu máy cục bộ, hãy cung cấp cho họ ít nhất một cửa sổ ngữ cảnh 16k mã thông báo (8k hoạt động với chế độ Thu gọn) — WebBrain tự động thu gọn cuộc trò chuyện khi nó gần đạt đến giới hạn.

🦙
llama.cpp
Ollama
OpenAI
Claude
OpenRouter
LM Studio
vLLM
Grok
Gemini
DeepSeek
Mistral
Logo WebBrain, một trái tim và logo Ollama cho thông báo bàn giao buổi ra mắt
Bàn giao ra mắt Ollama

Chọn mẫu Ollama rồi giao cho WebBrain

Đường dẫn khởi chạy mới có thể định cấu hình WebBrain cho kiểu Ollama cục bộ từ một lệnh đầu cuối. Nó hiện có sẵn từ chi nhánh Ollama của chúng tôi trong khi chúng tôi nỗ lực hướng tới tích hợp ngược dòng.

Đọc thông báo
Bắt đầu

Cài đặt WebBrain

Có sẵn cho Chrome, Edge và Firefox. Miễn phí, mã nguồn mở, không cần tài khoản.

Chrome & Crom

Manifest V3 · Chrome 116+ · Cũng hoạt động với Brave, Opera, Vivaldi và các trình duyệt tương thích với Chrome khác.

Microsoft Edge

Bản kê khai V3 · Windows 10/11 · Yêu cầu Microsoft Edge trên Windows.

Tại sao WebBrain?

WebBrain so sánh như thế nào?

WebBrain nằm ở điểm giao thoa giữa các plugin AI gốc của trình duyệt và khung tác nhân đầy đủ. Đây là cách nó xếp chồng lên nhau.

so với Plugin AI của trình duyệt

tính năng WebBrain Claude trong Chrome
Nguồn mởGiấy phép MITđộc quyền
GiáMiễn phí mãi mãiYêu cầu Claude Pro ($20/tháng)
Hỗ trợ LLM địa phươngllama.cpp, OllamaKhông - chỉ Claude
Đa nhà cung cấpTất cả các điểm cuối tương thích OpenAIchỉ có Claude
ChromeCó (MV3)
FirefoxCó (MV2)Không
Giao diện người dùng bảng điều khiển bên
Chế độ Hỏi/Hành độngTương tự
Hoàn toàn ngoại tuyếnCó (với LLM địa phương)Không - cần có đám mây
Tự lưu trữKhông

so với Khung tác nhân AI (khác loại)

Khía cạnh WebBrain OpenClaw/Sử dụng trình duyệt/v.v.
Nó là gì?Tiện ích mở rộng trình duyệt (công cụ dành cho người dùng cuối)Khung tác nhân/SDK (công cụ dành cho nhà phát triển)
Người dùng mục tiêuBất cứ ai - không cần mã hóaNhà phát triển xây dựng tự động hóa
Cài đặtCài đặt trình duyệt bằng một cú nhấp chuộtYêu cầu thiết lập Python/Docker
giao diện người dùngTrò chuyện bảng điều khiển bên tích hợpKhông có giao diện người dùng - chỉ có mã hoặc API
Kiểm soát trình duyệtKịch bản nội dung (nhẹ)CDP / Nhà viết kịch (toàn quyền kiểm soát)
Quy trình làm việc nhiều tabCuộc trò chuyện trên mỗi tabPhối hợp nhiều tab có thể lập trình
Chế độ không đầuKhông — chạy trong trình duyệt của bạnCó - tự động hóa không đầu
Khả năng mở rộngThêm nhà cung cấp LLM tùy chỉnhSDK Python đầy đủ, công cụ tùy chỉnh
Tốt nhất choTrợ lý AI duyệt web hàng ngàyĐường ống cạo / thử nghiệm tự động

WebBrain là một tiện ích mở rộng trình duyệt dành cho người dùng cuối muốn có trợ lý AI trong khi duyệt web. Các khung tác nhân như OpenClaw là công cụ dành cho nhà phát triển để xây dựng các đường dẫn trình duyệt tự động. Các công cụ khác nhau cho những công việc khác nhau — và bạn có thể sử dụng cả hai.

Câu hỏi thường gặp

Câu hỏi thường gặp

WebBrain có phải là giải pháp thay thế miễn phí cho plugin trình duyệt của Claude không?

Vâng. WebBrain cung cấp các khả năng tương tự của tác nhân trình duyệt AI — đọc trang, trích xuất dữ liệu, nhấp vào nút, điền biểu mẫu và tự động hóa quy trình làm việc nhiều bước. Không giống như plugin trình duyệt độc quyền của Claude yêu cầu đăng ký Claude Pro và chỉ hoạt động với các mẫu của Anthropic, WebBrain hoàn toàn miễn phí, nguồn mở (giấy phép MIT) và hỗ trợ nhiều nhà cung cấp LLM bao gồm các mẫu cục bộ chạy hoàn toàn trên máy của bạn.

Thuê bao WebBrain Cloud có giá bao nhiêu?

Đám mây WebBrain hiện đang $5/tháng cho mỗi hồ sơ thiết bị, rẻ hơn nhiều so với Claude Pro ở thời điểm hiện tại. Việc sử dụng hiện không giới hạn theo chính sách sử dụng hợp lý: sử dụng cá nhân bình thường là được, nhưng không được phép sử dụng lạm dụng, tự động, bán lại hoặc sử dụng số lượng lớn bất thường.

Đăng ký được liên kết với mã nhận dạng thiết bị do tiện ích mở rộng tạo ra cho trình duyệt đó + GUID hệ điều hành, chứ không phải với tài khoản người dùng. Nếu số nhận dạng đó bị mất do bạn đặt lại bộ nhớ tiện ích mở rộng, xóa hồ sơ trình duyệt, cài đặt lại trình duyệt, thay đổi trình duyệt/HĐH hoặc mất thiết bị, chúng tôi không thể truy xuất hoặc chuyển thiết bị đó và chúng tôi không hoàn lại tiền cho sự mất mát đó.

Bạn có thể đăng ký hoặc quản lý thanh toán từ Tài khoản phần của trang cài đặt plugin với Quản lý thanh toán nút. Để hủy thủ công, hãy liên hệ với chúng tôi qua email bằng địa chỉ email bạn đã sử dụng khi thanh toán.

Cloud Sync được mã hóa hoạt động như thế nào?

Cloud Sync là một tính năng tùy chọn dành cho những người đăng ký WebBrain Cloud đang hoạt động. Nó đồng bộ hóa bộ nhớ WebBrain, văn bản tự động điền hồ sơ và cấu hình nhà cung cấp được hỗ trợ, bao gồm cả khóa API. Nó có không đồng bộ hóa lịch sử trò chuyện, lịch sử trình duyệt, ảnh chụp màn hình trang hoặc mã thông báo làm mới và truy cập OAuth cũ.

Trình duyệt của bạn mã hóa kho đồng bộ hóa trước khi tải lên bằng mật khẩu bạn chọn. WebBrain Cloud chỉ lưu trữ kho tiền được mã hóa; nó không thể đọc ký ức, văn bản hồ sơ, cài đặt nhà cung cấp hoặc khóa API của bạn và không thể khôi phục mật khẩu đồng bộ hóa cho bạn.

Trường email dành cho xác thực đăng ký/thanh toán liên kết ma thuật trên đám mây WebBrain. Nó không phải là mật khẩu tài khoản. Nếu giao diện người dùng thông báo thay đổi mật khẩu trong Cloud Sync, điều đó có nghĩa là đồng bộ mật khẩu mã hóa, không phải mật khẩu tài khoản WebBrain.

Nếu bạn quên mật khẩu đồng bộ hóa, kho lưu trữ đám mây được mã hóa cũ sẽ không thể giải mã được. Bạn có thể đặt lại kho lưu trữ đám mây và tải lên bản sao được mã hóa mới từ thiết bị vẫn còn dữ liệu cục bộ.

WebBrain so sánh với OpenClaw, Sử dụng trình duyệt và các khung tác nhân AI khác như thế nào?

Chúng là những loại công cụ khác nhau. WebBrain là một tiện ích mở rộng của trình duyệt — bạn cài đặt nó trong Chrome hoặc Firefox và trò chuyện với nó trong bảng điều khiển bên cạnh, không cần mã hóa. Các khung như OpenClaw và Browser-Use là SDK dành cho nhà phát triển để xây dựng quy trình trình duyệt tự động bằng Python, thường sử dụng trình duyệt không có giao diện người dùng và CDP. Hãy nghĩ theo cách này: WebBrain dành cho duyệt web hàng ngày với trợ lý AI; các khung tác nhân dùng để xây dựng các bot quét và tự động hóa thử nghiệm. Bạn có thể sử dụng cả hai - chúng bổ sung cho nhau.

Tôi có thể sử dụng WebBrain hoàn toàn ngoại tuyến không?

Vâng. Nhà cung cấp mặc định của WebBrain là llama.cpp, chạy mô hình AI cục bộ trên máy tính của bạn. Không cần khóa API, không cần internet cho AI và không có dữ liệu nào rời khỏi máy của bạn. Chỉ cần tải xuống mô hình GGUF, khởi động máy chủ llama và bạn có một tác nhân trình duyệt AI hoàn toàn riêng tư. Bạn cũng có thể sử dụng Ollama với điểm cuối tương thích OpenAI.

WebBrain hỗ trợ những mẫu AI nào?

WebBrain hỗ trợ bốn loại nhà cung cấp: llama.cpp (bất kỳ mô hình GGUF cục bộ nào), OpenAI (GPT-4o, GPT-4, v.v.), Claude (Claude Opus, Sonnet, Haiku qua API gốc) và OpenRouter (truy cập vào hơn 100 mô hình từ nhiều nhà cung cấp khác nhau). Mọi điểm cuối API tương thích với OpenAI đều hoạt động, vì vậy bạn cũng có thể sử dụng các dịch vụ như Together AI, Groq, Mistral hoặc bất kỳ máy chủ cục bộ nào có giao diện tương thích với OpenAI.

Mô hình được khuyên dùng nhất là gì?

kể từ Ngày 21 tháng 4 năm 2026, khuyến nghị hàng đầu là Qwen 3.6 35B. Tại sao: trong tiêu chuẩn tầm nhìn của chúng tôi (tầm nhìn-mô hình-bắn súng), nó vượt trội hơn Gemma 4 về khả năng hiểu ảnh chụp màn hình trong khi vẫn thực tế cho suy luận cục bộ.

Đối với GPU dành cho người tiêu dùng, RTX 5090 là lý tưởng và RTX 4090 thường có thể hoạt động được với lượng tử hóa INT4 AutoRound thông qua Intel/Qwen3.6-35B-A3B-int4-AutoRound.

Để có tốc độ tối đa, chúng tôi khuyên bạn nên phân phát trên vLLM. Lệnh mẫu:

python -u -m vllm.entrypoints.openai.api_server --model Intel/Qwen3.6-35B-A3B-int4-AutoRound --served-model-name qwen3.6-35b --quantization auto --dtype bfloat16 --max-model-len 65536 --max-num-batched-tokens 32768 --max-num-seqs 4 --host 0.0.0.0 --port 8000 --gpu-memory-utilization 0.92 --enable-prefix-caching --enable-chunked-prefill --limit-mm-per-prompt '{"image": 4, "video": 1}' --mm-processor-cache-type shm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --trust-remote-code --allowed-origins '["*"]' --speculative-config '{"method": "dflash", "model": "z-lab/Qwen3.6-35B-A3B-DFlash", "num_speculative_tokens": 15}' --attention-backend flash_attn

Giải mã suy đoán DFlash là tùy chọn.

Tôi nhận được thông báo "Không tìm nạp được" khi kết nối với máy chủ LLM cục bộ (vLLM, Ollama, llama.cpp) trên mạng của mình

Nếu máy chủ LLM của bạn nằm trên một máy khác trong mạng cục bộ của bạn (ví dụ: http://192.168.1.x:8000), Chrome chặn yêu cầu trừ khi máy chủ gửi Tiêu đề CORS. Cách khắc phục tùy thuộc vào máy chủ của bạn:

vLLM: Bắt đầu với --allowed-origins '["*"]' (giá trị phải là danh sách JSON).
Ollama: Đặt biến môi trường OLLAMA_ORIGINS=* trước khi bắt đầu.
llama.cpp: CORS được bật theo mặc định - không cần thay đổi.

Nếu máy chủ của bạn chạy trên localhost (cùng máy với trình duyệt), CORS thường không bắt buộc. Sự cố chỉ ảnh hưởng đến kết nối nhiều máy trên mạng cục bộ. Đảm bảo URL cơ sở của bạn trong cài đặt WebBrain kết thúc bằng /v1 (ví dụ: http://192.168.1.47:8000/v1). Ngoại lệ: Ollama được sử dụng từ tiện ích mở rộng trình duyệt có thể vẫn cần OLLAMA_ORIGINS; xem Câu hỏi thường gặp về Ollama bên dưới.

Tại sao Ollama trên localhost trả về 403 từ tiện ích mở rộng WebBrain?

Các phiên bản Ollama gần đây có thể từ chối yêu cầu từ nguồn mở rộng trình duyệt ngay cả khi Ollama đang chạy trên cùng một máy. Tiện ích mở rộng sẽ gửi một Origin chẳng hạn như chrome-extension://... hoặc moz-extension://...và Ollama có thể trả lời 403 trừ khi những nguồn gốc đó được cho phép.

Thoát khỏi mọi ứng dụng máy tính để bàn Ollama đang giữ cổng 11434, sau đó khởi động Ollama bằng một trong các lệnh sau:

OLLAMA_ORIGINS="*" ollama serve
OLLAMA_ORIGINS="chrome-extension://*,moz-extension://*" ollama serve

Giữ URL cơ sở Ollama của WebBrain được đặt thành http://localhost:11434/v1. thiết bị đầu cuối curl kiểm tra vẫn có thể hoạt động mà không cần cài đặt này vì chúng không gửi nguồn gốc tiện ích mở rộng trình duyệt.

WebBrain có hoạt động trên Firefox không?

Vâng. WebBrain có cả phiên bản Chrome (Manifest V3, sử dụng API sidePanel) và phiên bản Firefox (Manifest V2, sử dụng sidebar_action). Cả hai phiên bản đều có tính năng giống hệt nhau. Phiên bản Firefox có thể được tải dưới dạng tiện ích bổ sung tạm thời để phát triển hoặc được xuất bản lên addons.mozilla.org để cài đặt vĩnh viễn.

Tôi có thể di chuyển thanh bên Firefox từ trái sang phải, giống như bảng điều khiển bên của Chrome không?

Có — Thanh bên của Firefox mặc định ở bên trái nhưng bạn có thể lật nó. Nhấp chuột phải vào bất kỳ đâu trong tiêu đề thanh bên và chọn Di chuyển thanh bên sang phải (hoặc sử dụng Xem → Thanh bên → Di chuyển Thanh bên sang phải từ thanh menu). Vị trí vẫn tồn tại trong quá trình khởi động lại. SidePanel của Chrome mặc định ở bên phải và người dùng không thể di chuyển khỏi bảng đó.

Có hạn chế nào khi sử dụng WebBrain trong Web Panel của Vivaldi không?

Vâng. Bảng điều khiển web Vivaldi ngăn chặn các hộp thoại JavaScript gốc như confirm(), alert()prompt(). Công tắc chuyển đổi chế độ Hỏi, Hành động và Nhà phát triển của WebBrain không còn phụ thuộc vào các hộp thoại đó nữa nhưng một số hành động phụ vẫn thực hiện.

Cuộc trò chuyện mới: Trong Bảng điều khiển Web, nút này có thể không hoạt động vì hộp thoại xác nhận của nó bị chặn. Nhấp chuột phải vào biểu tượng bảng WebBrain, chọn Mở trong → Tab mới, và sử dụng Cuộc trò chuyện mới từ tab thông thường đó.

Ghi âm: không sử dụng /record ở Vivaldi bây giờ. Nếu quá trình ghi không thành công, Vivaldi có thể ẩn cảnh báo lỗi và không để lại lời giải thích rõ ràng.

Cài đặt, Lịch sử, Dấu vết và chuyển giao Ollama: Chúng cũng chứa các hộp thoại gốc, nhưng WebBrain thường mở chúng dưới dạng tab thông thường, nơi chúng hoạt động. Nếu bạn đặt một bảng vào Bảng điều khiển Web theo cách thủ công, hãy mở nó trong tab thông thường trước khi sử dụng các hành động phụ thuộc vào hộp thoại.

WebBrain có an toàn khi sử dụng không? Nó có thể sửa đổi các trang web?

WebBrain có ba chế độ. Chế độ Hỏi (mặc định) là chỉ đọc và không thể sửa đổi bất cứ điều gì trên trang. Chế độ hành động cho phép các hành động của trình duyệt như nhấp, nhập và điều hướng, trong khi chế độ Dev bổ sung các công cụ gỡ lỗi trang. Các hành động tiếp theo cần được phê duyệt theo mặc định; nếu cổng cấp phép đó bị tắt, WebBrain sẽ hiển thị biểu ngữ cảnh báo hiển thị. Bạn có thể dừng tác nhân bất cứ lúc nào bằng nút Dừng. Mã nguồn của tiện ích mở rộng hoàn toàn mở để kiểm tra trên GitHub.

Biểu ngữ "WebBrain đã bắt đầu gỡ lỗi trình duyệt này" là gì? Tại sao WebBrain sử dụng CDP?

Để hoạt động trên một trang một cách đáng tin cậy, WebBrain sử dụng Giao thức DevTools Chrome (CDP) thông qua tiêu chuẩn chrome.debugger API tiện ích mở rộng - đó là những gì kích hoạt biểu ngữ "WebBrain đã bắt đầu gỡ lỗi trình duyệt này" của Chrome. CDP là thứ cho phép tác nhân nhấp và gõ bằng sự kiện đầu vào đáng tin cậy mà những địa điểm hiện đại thực sự tôn vinh; các sự kiện tổng hợp được kích hoạt từ tập lệnh nội dung bị nhiều trang web, Thành phần web và đầu vào do khung kiểm soát từ chối. Đó cũng là cách WebBrain chụp ảnh màn hình chính xác đến từng pixel để dự phòng tầm nhìn và tiếp cận iframe có nguồn gốc chéo và DOM bóng mà tập lệnh nội dung không thể nhìn thấy.

Chỉ đọc Chế độ hỏi không cần CDP — việc đọc trang và cây khả năng truy cập sẽ đi qua các tập lệnh nội dung thông thường. Đó là Chế độ hành động độ tin cậy và công việc có nguồn gốc chéo yêu cầu nó và trong tiện ích mở rộng Manifest V3 không có API không phải trình gỡ lỗi cho đầu vào đáng tin cậy. WebBrain đính kèm trình gỡ lỗi chỉ khi một hành động cần nó, trên mỗi tab và toàn bộ tiện ích mở rộng là nguồn mở nên bạn có thể kiểm tra chính xác hoạt động của phiên. CDP rất mạnh nên chúng tôi coi dấu vết của nó như một thứ gì đó cần chứa — đính kèm theo yêu cầu, tiếp tục đọc — và thắt chặt hơn nữa điều đó nằm trong lộ trình bảo mật của chúng tôi.

Nó hỏi tôi quá nhiều câu hỏi. Tôi có thể vô hiệu hóa nó được không?

Những lời nhắc phê duyệt đó là vì sự an toàn của bạn. Ngay cả trên các trang web mà bạn tin cậy, các tác nhân độc hại có thể bắt chước các hướng dẫn LLM hoặc chèn nội dung cố gắng khiến tác nhân thay mặt bạn thực hiện những việc mà bạn không chấp thuận. Đó là lý do tại sao WebBrain hỏi trước các hành động mang tính hậu quả. Nếu bạn vẫn không muốn xem qua những lời nhắc đó, hãy gõ /dangerously-skip-permissions trong bảng điều khiển bên cạnh hoặc mở plugin bên cạnh, nhấp vào biểu tượng bánh xe trong tiêu đề, đi tới Quyền tab vào settings.html, và tắt Hỏi trước các hành động mang tính hậu quả.

Làm cách nào để sử dụng WebBrain để quét web và trích xuất dữ liệu?

Chỉ cần mở bất kỳ trang web nào, mở bảng điều khiển bên WebBrain và hỏi bằng ngôn ngữ tự nhiên: "Trích xuất tất cả tên sản phẩm và giá từ trang này", "Nhận tất cả địa chỉ email trên trang này" hoặc "Tóm tắt bài viết này bằng dấu đầu dòng". Tác nhân AI đọc nội dung trang, hiểu cấu trúc và trả về dữ liệu được trích xuất. Để quét phức tạp hơn, hãy chuyển sang chế độ Hành động và nhân viên có thể điều hướng giữa các trang, nhấp vào nút phân trang và tổng hợp dữ liệu trên nhiều trang.

WebBrain có gọi API trực tiếp hay luôn nhấp qua giao diện người dùng?

Theo mặc định, WebBrain luôn đi qua giao diện người dùng hiển thị đối với bất kỳ hành động nào tạo, sửa đổi, xóa, gửi, gửi, đăng hoặc mua bất kỳ thứ gì. Nó sẽ điều hướng đến trang, điền vào biểu mẫu và nhấp vào nút - chính xác theo cách bạn muốn. Nó từ chối gọi trực tiếp các điểm cuối REST/GraphQL qua nền fetch() đối với các đột biến. Điều này là có chủ ý: Các hành động API là vô hình (bạn không nhìn thấy những gì đang được gửi), thường yêu cầu các mã thông báo xác thực riêng biệt mà bạn có thể chưa định cấu hình và có bán kính vụ nổ lớn hơn nhiều so với một lần bấm nhầm có thể nhìn thấy được. Ưu tiên giao diện người dùng có nghĩa là mọi thứ đều hiển thị trên màn hình, trong phiên trình duyệt thông thường của bạn và có thể dừng lại.

cho đọc sách dữ liệu — tìm nạp README, tra cứu vấn đề, so sánh giá giữa các trang web, kiểm tra trang trạng thái — WebBrain tự do sử dụng các yêu cầu HTTP nền thông qua fetch_urlresearch_url công cụ. Đọc không giống như diễn; nó không thay đổi bất cứ điều gì trên một dịch vụ từ xa, vì vậy những lo ngại về an toàn không được áp dụng.

Nếu bạn đặc biệt muốn cho phép đột biến API cho một tác vụ cụ thể, hãy nhập /allow-api ở đầu tin nhắn của bạn (tùy chọn theo sau là một mô tả nhiệm vụ ngắn). Tính năng ghi đè mỗi cuộc hội thoại này cho phép WebBrain quay trở lại điểm cuối API khi giao diện người dùng thực sự bị lỗi hoặc không thể hoạt động được, trong khi vẫn ưu tiên giao diện người dùng khi giao diện người dùng hoạt động. Huy hiệu cố định vẫn hiển thị phía trên khu vực nhập liệu trong khi tính năng ghi đè được kích hoạt và biểu tượng này sẽ xóa khi bạn đặt lại cuộc trò chuyện.

Tôi có thể sử dụng nó trong LM Studio không?

Vâng. Công cụ mạng chỉ đọc của WebBrain — fetch_urlresearch_url - cũng được vận chuyển dưới dạng độc lập LM Studio cắm vào webbrain/công cụ web. Cài đặt với lms clone webbrain/web-tools và bật nó trong bất kỳ cuộc trò chuyện LM Studio nào - sau đó, bất kỳ kiểu máy nào có khả năng sử dụng công cụ đều có thể gọi hai công cụ đó mà không cần bạn cài đặt tiện ích mở rộng trình duyệt. Nút thuần túy, không có trình duyệt không đầu. Nguồn: lmstudio-plugin/.

Tôi có thể chuyển sang tab khác trong khi WebBrain đang hoạt động trên một trang không?

Có, trên Chrome — tác nhân chạy trong trình chạy dịch vụ nền và được liên kết với tab mà nó đã bắt đầu, do đó, tác nhân sẽ tiếp tục nhấp, nhập và đọc tab cụ thể đó ngay cả khi bạn di chuyển tiêu điểm sang nơi khác. Các công cụ nhắm mục tiêu một tab (nhấp CDP, nhập, điều hướng, chụp màn hình) đều hoạt động trên các tab nền trong Chrome. Thanh bên khóa đầu vào trong khi một tác vụ đang chạy để bạn không thể vô tình bắt đầu tác vụ thứ hai trên tab mới — bạn sẽ cần đợi hoặc dừng tác vụ hiện tại. Lưu ý rằng trình duyệt điều chỉnh bộ tính giờ và hoạt ảnh trên các tab nền, vì vậy các trang web có nhiều hoạt ảnh có thể phản hồi chậm hơn một chút.

Trên Firefox, tác nhân cũng sẽ tiếp tục chạy trên tab gốc nhưng ảnh chụp màn hình tự động bị hạn chế: API ảnh chụp màn hình của Firefox chỉ có thể chụp tab hiện đang hoạt động chứ không thể chụp một tab cụ thể ở chế độ nền. WebBrain phát hiện điều này và bỏ qua ảnh chụp màn hình cho lượt đó thay vì cung cấp cho mô hình hình ảnh của một trang không liên quan. Nhân viên hỗ trợ sẽ tiếp tục lập kế hoạch từ ngữ cảnh dựa trên văn bản cho đến khi bạn chuyển về tab của nhân viên đó.

Tránh chủ động nhấp hoặc gõ vào cùng một tab mà nhân viên đang làm việc - điều đó tạo ra các điều kiện chạy đua trong đó bạn và người đại diện chiến đấu trên cùng một trang. Chuyển đổi tab là tốt; đồng lái xe cùng một tab thì không.

Tính năng tự động điền hồ sơ hoạt động như thế nào và có an toàn không?

Tự động điền hồ sơ là một tính năng tùy chọn trong Cài đặt → Hồ sơ. Bạn nhập một tiểu sử ngắn gọn — tên, email công việc, công ty và địa chỉ đồ bỏ đi mật khẩu dành cho những người đăng ký có mức đặt cược thấp — và bật nó lên. Khi được bật, WebBrain sẽ thêm văn bản đó vào lời nhắc hệ thống của tổng đài viên để nó có thể điền vào biểu mẫu đăng ký mà không cần phải hỏi mọi lúc.

Văn bản được lưu trữ trong bản rõ trong bộ nhớ cục bộ của trình duyệt của bạn. Đó là không được truyền tới dự án WebBrain, nhưng nó được gửi tới bất kỳ nhà cung cấp LLM nào mà bạn đã định cấu hình mỗi lần, như một phần của lời nhắc hệ thống. Tắt theo mặc định.

Không đặt mật khẩu cho những tài khoản quan trọng (Google, Apple, iCloud, ngân hàng, SSO cơ quan, email chính) tại đây. Những tài khoản đó nên sử dụng 2FA và không nên giao cho đại lý. Mật khẩu dùng một lần mà bạn sử dụng lại để đăng ký bản tin và dùng thử miễn phí là trường hợp sử dụng dự kiến.

Cài đặt chỉnh sửa Ảnh chụp màn hình có đảm bảo dữ liệu riêng tư của tôi không bao giờ đạt tới mô hình thị giác trên đám mây không?

Không - nó làm giảm mức độ phơi nhiễm, nó không phải là sự đảm bảo. Khi được bật (Cài đặt → Đa chế độ → Chỉnh sửa ảnh chụp màn hình, tắt theo mặc định), WebBrain tạo pixel các trường biểu mẫu và văn bản trông giống địa chỉ email hoặc số điện thoại trên mỗi ảnh chụp màn hình trước đây nó được gửi đến một mô hình tầm nhìn. Tính năng phát hiện chạy hoàn toàn trên thiết bị của bạn bằng phương pháp phỏng đoán DOM; không có gì thêm được truyền đi.

Đó là nỗ lực tốt nhất và thất bại. Nếu trình phát hiện không thể chạy trên một trang — ví dụ: ngay sau khi điều hướng, trên trình xem PDF hoặc trên các trang trình duyệt bị hạn chế — thì ảnh chụp màn hình vẫn được gửi chưa được biên soạn thay vì hủy bỏ nhiệm vụ của bạn. Nội dung mà phương pháp chẩn đoán DOM không thể nhìn thấy (văn bản được vẽ trên canvas, hình ảnh PII bên trong, các vật dụng bất thường) cũng có thể bị lọt qua. Và cài đặt chỉ bao gồm ảnh chụp màn hình: trang văn bản được gửi đến mô hình không bị nó biên tập lại.

Để có được sự riêng tư toàn diện về tầm nhìn, hãy sử dụng mô hình cục bộ. Với nhà cung cấp ngoại tuyến như llama.cpp hoặc Ollama, ảnh chụp màn hình và văn bản trang sẽ không bao giờ rời khỏi máy của bạn, do đó, không có gì cần chỉnh sửa ngay từ đầu — đó là cấu hình duy nhất đảm bảo quyền riêng tư. Xem "Tôi có thể sử dụng WebBrain hoàn toàn ngoại tuyến không?" bên trên.

Bạn không có máy có thể chạy mô hình địa phương có khả năng nhìn? Nền tảng trung bình tốt là một mô hình cục bộ nhỏ để lập kế hoạch và gọi công cụ (đủ nhanh và nhẹ cho CPU/GPU khiêm tốn) được ghép nối với nhà cung cấp đám mây cho các lệnh gọi phụ tầm nhìn, có bật tính năng chỉnh sửa Ảnh chụp màn hình. Bạn vẫn giữ cuộc trò chuyện và văn bản trên trang của mình trên thiết bị, đồng thời mọi ảnh chụp màn hình dành cho chế độ xem trên đám mây đều có các trường biểu mẫu và email/điện thoại được phát hiện trước tiên sẽ bị làm mờ — giảm mức độ hiển thị trên đám mây mà không cần phần cứng cho mô hình tầm nhìn cục bộ đầy đủ. Định cấu hình phân chia tầm nhìn bên dưới Cài đặt → Tầm nhìn (xem "WebBrain làm cách nào để kiểm soát hóa đơn LLM trên đám mây?" ở trên).

WebBrain làm gì với biểu ngữ cookie và tường phí?

Biểu ngữ bánh quy: WebBrain nhận dạng các biểu ngữ lấy sự đồng ý từ các khuôn khổ phổ biến (OneTrust, Cookiebot, Didomi, Quantcast, Google Funding Choices, TrustArc) và loại bỏ chúng trước khi đưa ra lý do về trang. Ưu tiên là "Từ chối tất cả" / "Từ chối không cần thiết" / "Chỉ cần thiết" khi nhìn thấy rõ ràng; nó quay trở lại "Chấp nhận tất cả" thay vì biến mất trong mê cung "Quản lý tùy chọn".

Tường phí: WebBrain báo cáo tường phí một cách trung thực và cho bạn biết những gì nó thực sự có thể nhìn thấy (tiêu đề, nội dung, đoạn đầu tiên). Nó có không cố gắng vượt qua các bức tường thanh toán - không có archive.today, 12ft.io, xóa cookie, vô hiệu hóa JS hoặc các thủ thuật ở chế độ đọc. Nếu bạn muốn có toàn bộ bài viết, hãy đăng nhập bằng cách đăng ký hoặc yêu cầu WebBrain tìm kiếm bản tin miễn phí về cùng một câu chuyện.

WebBrain có hỗ trợ chế độ chạy khô không?

kể từ 7.0.0, chưa. Chế độ chạy thử đã được lên kế hoạch và đã có sẵn trên lộ trình.

WebBrain kiểm soát hóa đơn LLM trên đám mây như thế nào?

Ba lớp độc lập:

Ảnh chụp màn hình có ý thức về mã thông báo. Trước khi bất kỳ hình ảnh nào rời khỏi máy của bạn, WebBrain sẽ thay đổi kích thước hình ảnh đó (giới hạn cạnh ngắn hơn, giữ nguyên tỷ lệ khung hình) và nén JPEG lặp đi lặp lại cho đến khi phù hợp với ngân sách mã thông báo hình ảnh mỗi lượt. Ảnh chụp màn hình 2000×1200 sẽ tiêu tốn của bạn ~1.500 mã thông báo đầu vào trên GPT-4o sẽ được nén xuống ~300–500 mã thông báo mà không gây tổn thất thực tế nào cho các tác vụ đọc trang. Thực hiện tại _fitImageDimensions với các bài kiểm tra đơn vị cho môn toán ngân sách.

Cắt tỉa bối cảnh thông minh. Lịch sử hội thoại, kết quả đầu ra của công cụ và kết xuất DOM nội tuyến được giới hạn mỗi lượt và được cắt bớt cũ nhất trước tiên khi cửa sổ ngữ cảnh của mô hình đang hoạt động sắp đầy. Bạn sẽ không thấy bong bóng đang chạy âm thầm từ 10k token lên 100k vì một read_page đã trả lại một bài báo dài như tiểu thuyết.

Mô hình tầm nhìn chuyên dụng. Ghép nối một mô hình văn bản giá rẻ (ví dụ: GPT-4o-mini) để lập kế hoạch và gọi công cụ với một mô hình có khả năng hiển thị riêng biệt (ví dụ: GPT-4o) chỉ dành cho ảnh chụp màn hình, do đó, bạn không phải trả giá cho mô hình đa phương thức cho mỗi lượt. Cấu hình dưới Cài đặt → Tầm nhìn.

Kết quả cuối cùng: các phiên dài với các nhà cung cấp đám mây luôn có thể dự đoán được. Để có toàn quyền kiểm soát, hãy sử dụng llama.cpp cục bộ — không tốn phí cho mỗi mã thông báo.

Tôi có thể đóng góp cho WebBrain không?

Chắc chắn rồi! WebBrain được MIT cấp phép và hoan nghênh những đóng góp. Kiểm tra Kho lưu trữ GitHub về các vấn đề, yêu cầu tính năng và hướng dẫn đóng góp.

Lan tỏa, chia sẻ yêu thương

WebBrain được MIT cấp phép và chạy hoàn toàn trên trình duyệt của bạn. Nếu nó hữu ích, hãy đánh dấu sao cho chúng tôi hoặc chia sẻ nó — đó là cách các dự án nguồn mở độc lập được tìm thấy.