Tóm tắt điều hành
Tín hiệu rõ nhất hôm nay không đến từ một con agent biết nói, mà từ tầng ít ai để ý: lấy dữ liệu vào cho AI. Hàng loạt repo biến tài liệu và web thành văn bản sạch đang leo hạng cùng lúc — từ ông lớn microsoft/markitdown (177,2k sao) và firecrawl/firecrawl (166,2k sao) tới lớp công cụ Rust siêu nhanh như firecrawl/anydoc và các thư viện trích xuất có cấu trúc mới nổi. Thông điệp cho builder Việt: mô hình ngày càng rẻ và gần giống nhau, nên lợi thế cạnh tranh dịch chuyển về chất lượng dữ liệu đầu vào. Ai làm chủ khâu biến PDF, hợp đồng, hoá đơn, trang web lộn xộn thành context sạch sẽ chiếm phần khó nhất — và dễ bán nhất — của mọi sản phẩm AI.
Đây cũng là cụm dễ kiếm tiền nhất với đội nhỏ: không cần huấn luyện mô hình, không cần GPU đắt, chỉ cần ghép đúng công cụ mã nguồn mở thành một dịch vụ “làm sạch dữ liệu → sẵn sàng cho AI”. Bản tin hôm nay điểm 8 repo trong tầng này, kèm góc đóng gói bán cho doanh nghiệp nhỏ.
Bản đồ xu hướng
Ba dịch chuyển đáng chú ý trong tầng dữ liệu:
- Từ “đọc được” sang “sạch cho LLM”. Các công cụ không còn chỉ trích text thô mà giữ cấu trúc bảng, tiêu đề, thứ tự đọc — vì token bẩn làm hỏng RAG và tốn tiền gọi mô hình. Markdown trở thành định dạng trung gian mặc định giữa tài liệu và AI.
- Rust hoá phần lõi để hạ chi phí. anydoc và pdf-inspector viết bằng Rust, parse tài liệu ở mức mili-giây, chạy được cả trên máy yếu và WebAssembly — mở đường cho xử lý số lượng lớn với chi phí hạ tầng thấp.
- Trích xuất có cấu trúc dựa trên schema. Thay vì để mô hình tự do trả lời, lớp công cụ mới bắt LLM điền đúng trường dữ liệu bạn khai báo, kèm dẫn chứng câu gốc — biến tài liệu thành JSON nhập thẳng vào phần mềm.
Điểm chung: đây là hạ tầng “vô hình” nhưng nằm ngay trước mọi chatbot, mọi agent, mọi báo cáo tự động. Chọn sai công cụ ở tầng này thì mô hình xịn đến mấy cũng cho ra kết quả rác.
Cụm công nghệ trong ngày
RAG & Data — web-to-context
Cửa ngõ đầu tiên là lấy dữ liệu sống từ web. firecrawl/firecrawl đóng vai “context API”: search, scrape, crawl và trả về Markdown sạch cho agent, thay cho việc tự viết scraper dễ vỡ. Đây là mảnh ghép phổ biến nhất khi cần cho AI đọc trang sản phẩm, tin tức, tài liệu công khai theo thời gian thực.
RAG & Data — tài liệu thành Markdown
Nhóm đông đảo nhất hôm nay là chuyển tài liệu offline thành Markdown/JSON: microsoft/markitdown cho phổ dụng, opendatalab/MinerU và docling-project/docling mạnh về giữ cấu trúc bảng và layout phức tạp, còn firecrawl/anydoc cùng firecrawl/pdf-inspector tối ưu tốc độ bằng Rust và biết phân loại PDF scan hay PDF text để định tuyến xử lý cho khỏi lãng phí.
RAG & Data — bóc dữ liệu có cấu trúc
Lớp trên cùng biến văn bản thành dữ liệu dùng được: shcherbak-ai/contextgem cho khai báo schema rồi để LLM tự chia nhỏ, trích và kiểm chứng; NanoNets/docstrange gộp OCR nâng cao với trích trường dữ liệu để xử lý cả tài liệu scan chất lượng thấp. Đây là mắt xích nối “tài liệu đọc được” với “phần mềm chạy được”.
Nối tiếp sang RAG & Agent
Cả ba lớp trên chỉ có giá trị khi cắm vào một kho vector và một agent. Đó là lý do tầng dữ liệu sạch đi liền với hạ tầng lưu trữ như trong bài Qdrant cho startup RAG Việt — dữ liệu càng sạch, truy hồi càng đúng, chi phí gọi mô hình càng giảm.
Repo đáng chú ý
Mỗi repo dưới đây có trang phân tích riêng trong kho tri thức AIToEarn — bấm vào tên repo để đọc chi tiết ứng dụng và hướng kiếm tiền; link GitHub chính chủ chỉ là nguồn phụ đặt cuối câu.
microsoft/markitdown
Công cụ Python của Microsoft biến file Office, PDF, ảnh, âm thanh thành Markdown chuẩn cho LLM — ⭐ 177,2k (ghi nhận), license MIT. Là lựa chọn “mặc định an toàn” khi cần một bộ chuyển đổi đa định dạng dễ tích hợp. Góc kiếm tiền: dựng dịch vụ tiền xử lý tài liệu cho các đội đang xây chatbot nội bộ nhưng ngại tự làm khâu parsing. Xem trên GitHub
firecrawl/firecrawl
Context API để search, scrape và crawl web ở quy mô lớn, trả về Markdown sẵn cho agent — ⭐ 166,2k (ghi nhận), license AGPL-3.0. Góc kiếm tiền: bán dịch vụ “giám sát và bóc dữ liệu web theo ngành” (giá, tin tức, đối thủ) cho SME, nhưng lưu ý ràng buộc AGPL khi tích hợp vào sản phẩm đóng. Xem trên GitHub
opendatalab/MinerU
Biến tài liệu phức tạp như PDF và file Office thành Markdown/JSON sẵn cho workflow agent, mạnh về công thức và bảng — ⭐ 77,4k (ghi nhận), viết bằng Python. Góc kiếm tiền: dịch vụ số hoá tài liệu học thuật, kỹ thuật, y tế cho tổ chức có kho PDF lớn. Xem trên GitHub
docling-project/docling
Bộ công cụ khởi nguồn từ IBM, chuẩn hoá PDF/DOCX/PPTX thành tài liệu sẵn sàng cho gen AI với nhận diện layout và bảng chính xác — ⭐ 65,8k (ghi nhận), license MIT. Góc kiếm tiền: đóng gói thành pipeline “hợp đồng/báo cáo → Markdown → RAG” tính phí theo trang. Xem trên GitHub
firecrawl/anydoc
Thư viện Rust chuyển 14 định dạng (Word, PowerPoint, Excel, EPUB, PDF…) thành Markdown sạch ở mức mili-giây, có binding Node.js và Python — ⭐ 16,5k (ghi nhận), license MIT. Góc kiếm tiền: làm lõi tốc độ cao cho SaaS xử lý tài liệu số lượng lớn, hạ chi phí server so với giải pháp Python. Xem trên GitHub
shcherbak-ai/contextgem
Framework trích xuất dữ liệu có cấu trúc từ tài liệu chỉ bằng khai báo schema, tự chia nhỏ và kèm trích dẫn nguồn — ⭐ 2,0k (ghi nhận), license Apache-2.0. Góc kiếm tiền: bán module “biểu mẫu/hợp đồng → JSON” cho phòng pháp chế, nhân sự, kế toán theo gói xử lý hàng tháng. Xem trên GitHub
Cơ hội triển khai
- Dịch vụ “làm sạch dữ liệu cho AI” trọn gói. Ghép markitdown/docling (parse) + contextgem (trích trường) + một vector store, bán cho SME muốn có chatbot tra cứu tài liệu mà không có đội kỹ thuật. Tính phí theo số trang và số câu hỏi.
- Số hoá chứng từ theo lô. Dùng docstrange + pdf-inspector để xử lý hoá đơn, biên lai, hồ sơ giấy thành bảng dữ liệu cho kế toán và kho vận — bài toán rất “đời”, khách sẵn trả tiền, không cần AI hào nhoáng.
- Bộ thu thập dữ liệu ngành. Dùng firecrawl để dựng “radar” theo dõi giá, tin tức, đối thủ cho một ngách (bất động sản, F&B, tuyển dụng) và bán báo cáo định kỳ.
Rủi ro cần theo dõi
- License không đồng nhất. Phần lớn nhóm này là MIT/Apache-2.0 rất thoáng, nhưng firecrawl dùng AGPL-3.0 — nếu nhúng vào sản phẩm đóng và cung cấp qua mạng, bạn có thể bị buộc mở mã. Đọc kỹ trước khi thương mại hoá.
- Chất lượng trích xuất không đồng đều. Tài liệu scan mờ, bảng lồng nhau, PDF nhiều cột vẫn dễ ra kết quả sai. Luôn có bước kiểm tra và giữ trích dẫn nguồn để người dùng đối chiếu, đừng để AI “bịa” số liệu tài chính, pháp lý.
- Chi phí ẩn khi quy mô lớn. Parse thì rẻ, nhưng bước trích xuất bằng LLM và lưu vector có thể đội chi phí nhanh khi số trang tăng. Ước lượng chi phí theo trang thật trước khi cam kết giá trọn gói với khách.
Danh sách đầy đủ
- microsoft/markitdown — file & Office → Markdown cho LLM — ⭐ 177,2k — RAG & Data
- firecrawl/firecrawl — context API search/scrape/crawl web — ⭐ 166,2k — RAG & Data
- opendatalab/MinerU — tài liệu phức tạp → Markdown/JSON — ⭐ 77,4k — RAG & Data
- docling-project/docling — chuẩn hoá tài liệu cho gen AI (IBM) — ⭐ 65,8k — RAG & Data
- firecrawl/anydoc — 14 định dạng → Markdown, Rust, mili-giây — ⭐ 16,5k — RAG & Data
- firecrawl/pdf-inspector — phân loại & trích text PDF, không OCR — ⭐ 9,0k — RAG & Data
- shcherbak-ai/contextgem — trích dữ liệu có cấu trúc theo schema — ⭐ 2,0k — RAG & Data
- NanoNets/docstrange — mọi tài liệu → Markdown/JSON/CSV + OCR — ⭐ 1,5k — RAG & Data
Muốn đóng gói cả tầng dữ liệu này thành một sản phẩm bán được? Xem thêm Tổng hợp giải pháp tuần để ráp các mảnh thành dịch vụ hoàn chỉnh.
Nguồn tham khảo
- github.com/microsoft/markitdown
- github.com/firecrawl/firecrawl
- github.com/opendatalab/MinerU
- github.com/docling-project/docling
- github.com/firecrawl/anydoc
- github.com/firecrawl/pdf-inspector
- github.com/shcherbak-ai/contextgem
- github.com/NanoNets/docstrange
— Ban biên tập AIToEarn.
