WeKnora: biến đống tài liệu lộn xộn thành wiki tự cập nhật


Bạn có một thư mục vài trăm file: hợp đồng PDF, báo cáo Word, bảng số liệu Excel, thêm vài tấm ảnh chụp màn hình. Đến lúc cần tìm “điều khoản phạt vi phạm với khách A là gì”, bạn lại mở từng file ra dò. Hỏi chatbot thì nó chỉ trả lời được nếu bạn đã dán sẵn nội dung vào, mà dán cả thư mục thì không xuể.

WeKnora là một dự án mã nguồn mở của Tencent sinh ra để giải đúng bài toán này. Bài viết dưới đây nói nó làm được gì, cài thế nào, và những chỗ bạn nên tỉnh táo trước khi đặt cược cả kho tài liệu vào nó.

WeKnora là gì?

Nói gọn, đây là một nền tảng tri thức chạy trên mô hình ngôn ngữ lớn: bạn đưa tài liệu vào, nó đọc, phân tích rồi trả lời câu hỏi dựa trên chính tài liệu đó. Dự án dùng giấy phép MIT, nghĩa là dùng miễn phí, sửa thoải mái. Tại thời điểm viết bài, kho mã trên GitHub có khoảng 26,8 nghìn sao, 3,6 nghìn lượt fork và bản mới nhất là 0.8.0.

Một chi tiết hay bị hiểu nhầm: WeKnora không phải “lõi của WeChat”. Theo README, nó là nền tảng công nghệ đứng sau Nền tảng Mở đối thoại WeChat (WeChat Dialog Open Platform), tức mảng chatbot trả lời tự động cho tài khoản chính thức và mini program. Vẫn là dự án nghiêm túc của Tencent, chỉ là đừng nghĩ nó chính là phần ruột của ứng dụng nhắn tin.

Ba cách hỏi đáp, từ nhanh đến sâu

WeKnora xoay quanh ba chế độ, và hiểu rõ chúng là hiểu được nửa dự án.

Chế độ đầu tiên là hỏi đáp nhanh theo kiểu RAG. Hiểu đơn giản, hệ thống tìm những đoạn tài liệu liên quan đến câu hỏi rồi đưa cho mô hình đọc để trả lời. Phần tìm kiếm ở đây khá đầy đủ: kết hợp tìm theo từ khóa (BM25), tìm theo ngữ nghĩa (vector) và cả GraphRAG, tức dựa trên đồ thị quan hệ giữa các thực thể.

Chế độ thứ hai là Agent. Với những câu hỏi cần nhiều bước, ví dụ vừa tra tài liệu nội bộ, vừa tìm thêm trên web, vừa chạy một đoạn xử lý số liệu, agent tự quyết định dùng công cụ nào theo từng bước. Nó gọi được công cụ qua MCP, tìm kiếm web và chạy mã trong môi trường cô lập.

Chế độ thứ ba, và cũng là chế độ đáng chú ý nhất, là Wiki. Thay vì mỗi lần hỏi lại đi lục tài liệu gốc từ đầu, agent đọc tài liệu thô rồi viết thành các trang markdown có liên kết chéo với nhau, kèm một đồ thị tri thức để bạn xem các trang nối với nhau ra sao. Bạn vẫn sửa tay được từng trang, xem lại lịch sử chỉnh sửa và khôi phục về bản cũ bằng một cú bấm. Nhờ vậy kiến thức không còn nằm chết trong file mà đã được “biên tập” sẵn, dễ đọc và dễ kiểm tra. README cho biết từ bản 0.5.2, khâu nạp tài liệu vào wiki đã chịu được kho cỡ 40 nghìn tài liệu.

Những điểm đáng giá khác của WeKnora

Về đầu vào, WeKnora đọc được hơn mười định dạng: PDF, Word, Excel, PowerPoint, ảnh, markdown, HTML, EPUB, cả file XMind. Riêng file Office, bản 0.8.0 có bộ đọc anydoc phân tích trực tiếp trong tiến trình nên đỡ phải chuyển đổi qua lại. Nếu tài liệu của bạn nằm sẵn trên các dịch vụ khác, nó đồng bộ được từ Feishu, GitLab, Notion, Yuque, DingTalk Docs, Tencent IMA và cả nguồn tin RSS.

Bản 0.8.0 còn thêm skill chạy trong sandbox (môi trường cô lập) bằng Docker, E2B hoặc Cube. Ý tưởng là agent không chỉ đọc kiến thức mà còn chạy được các kỹ năng đóng gói sẵn, ví dụ tạo và xem trước một file Word ngay trong cuộc trò chuyện. Bạn cài skill từ ClawHub, SkillHub, git hoặc file zip. Lưu ý là Docker chỉ là lựa chọn tùy chọn bật, và phương án chạy thẳng trên máy chủ đã bị gỡ.

Bên cạnh đó có bộ nhớ dài hạn xuyên section: hệ thống ghi nhận hồ sơ, sở thích, sự kiện, nhiệm vụ và mối quan tâm của bạn, rồi tra lại khi cần. Nó tự trích xuất nhưng có bước cho bạn xác nhận, nên bạn không bị ghi nhớ những thứ mình không muốn.

Về mô hình, danh sách hỗ trợ rất rộng: OpenAI, Anthropic (Claude), DeepSeek, Qwen, Gemini, Zhipu, Hunyuan, cùng Ollama nếu bạn muốn chạy mô hình ngay trên máy. README nói có hơn 20 nhà cung cấp, và bạn đổi qua lại được, không bị khóa vào một hãng, model nào.

Cuối cùng là phần dành cho ai định dùng trong nhóm hoặc công ty: phân quyền theo không gian làm việc với bốn vai trò (Owner, Admin, Contributor, Viewer), khóa API giới hạn quyền, nhật ký kiểm toán, mã hóa thông tin đăng nhập và tích hợp Langfuse để theo dõi agent đã suy luận thế nào, tốn bao nhiêu token.

Cài đặt WeKnora

Bạn cần Docker và Git. Các lệnh chính thức trong README như sau:

git clone https://github.com/Tencent/WeKnora.git
cd WeKnora
cp .env.example .env
docker compose pull
docker compose up -d

Chạy xong, mở http://localhost để vào giao diện. Nếu muốn dùng mô hình chạy cục bộ, bật Ollama trước bằng ollama serve.

Mẹo: bản mặc định chỉ chạy các dịch vụ lõi. Muốn có đồ thị tri thức bằng Neo4j, lưu trữ bằng MinIO hay theo dõi bằng Langfuse thì thêm cờ --profile tương ứng (neo4j, minio, langfuse), hoặc --profile full để bật tất cả. Nhớ mở file .env xem qua trước khi khởi động để điền khóa API của mô hình bạn dùng.

Nối WeKnora với Claude Code được không?

Đây là câu nhiều người sẽ hỏi. README không nhắc đến Claude Code, nhưng WeKnora có sẵn MCP Server (gói tencent-weknora-mcp, 29 công cụ) và một công cụ dòng lệnh weknora thiết kế cho agent, kèm plugin chính thức cho DeepSeek Harness. Nên về nguyên lý, cho một agent lập trình đọc kho tài liệu qua MCP là hướng làm hợp lý. Có điều đây là suy luận từ những gì README liệt kê, chưa có hướng dẫn chính thức cho Claude Code, nên bạn cần tự thử và tự cấu hình.

Chỗ cần tỉnh táo

Đừng kỳ vọng phép màu. Chất lượng trang wiki phụ thuộc vào mô hình bạn gắn vào và vào độ sạch của tài liệu đầu vào. Vì wiki do mô hình viết, kho càng lớn thì càng tốn lượt gọi mô hình, nên hãy thử trên một bộ tài liệu nhỏ trước để ước lượng chi phí.

Về bảo mật, chính README khuyên triển khai trong mạng nội bộ, không phơi bài thẳng ra internet. Trên trang thống kê lỗ hổng của Go có hai cảnh báo (GO-2026-4292 về chèn lệnh trong chức năng thử MCP stdio và GO-2026-4293 về chèn SQL), gắn với phiên bản cũ v0.1.5 xuất bản tháng 10/2025. Các bản 0.7.x sau này có hàng loạt bản vá bảo mật, nhưng lời khuyên vẫn là dùng bản mới nhất và đặt sau tường lửa. Ngoài ra dự án vẫn ở đời 0.x, đang phát triển rất nhanh và còn hàng trăm issue mở, nên đừng bất ngờ nếu gặp lỗi vặt.

Có nên thử WeKnora không?

Nếu bạn đang ôm một kho tài liệu lớn và mệt vì phải tìm bằng tay, WeKnora đáng dành một buổi chiều cài thử, nhất là chế độ Wiki. Cứ bắt đầu từ vài chục file quen thuộc, hỏi những câu bạn đã biết đáp án để kiểm tra độ chính xác, rồi hãy tính chuyện mở rộng. Bạn đã thử công cụ nào tương tự chưa? Kể kinh nghiệm bên dưới nhé!


Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *