Thứ Tư, 09/09/2026

Ban tin AI 09-09-2026 - Tu OCR den du lieu co cau truc

Bản tin AIToEarn — Thứ Tư, 09/09/2026. Tín hiệu GitHub hôm nay dồn về một chỗ: các repo biến tài liệu thô thành dữ liệu máy đọc được. Mỗi repo được điểm đều có trang phân tích riêng trong kho tri thức AIToEarn — bấm vào tên repo để đọc chi tiết.

Tóm tắt điều hành

Hôm nay bảng xu hướng không nói về một con agent biết chat hay biết bấm nút. Nó nói về thứ nhàm chán hơn nhưng ra tiền nhanh hơn: đọc tài liệu và bóc nó thành dữ liệu có cấu trúc. Cụm “Document AI” đang chiếm sóng với những repo đã vượt mốc chục nghìn tới gần trăm nghìn sao — PaddlePaddle/PaddleOCR (⭐ 88.8k), opendatalab/MinerU (⭐ 77.4k), docling-project/docling (⭐ 66.2k). Đây không phải hype phòng lab; đây là lớp hạ tầng mà mọi ứng dụng RAG, mọi chatbot doanh nghiệp, mọi bot kế toán đều phải đi qua.

Điểm mấu chốt cho builder Việt: OCR thuần đã là hàng hoá phổ thông, nhưng khoảng cách giữa “ảnh có chữ” và “JSON dùng được” vẫn còn rộng — và đó chính là nơi tính được tiền. Ai ghép được OCR + bố cục + trích trường có kiểm chứng thành một dịch vụ đóng gói cho ngành cụ thể (kế toán, bảo hiểm, công chứng, y tế) sẽ bán được ngay, vì khách hàng không quan tâm model nào, họ chỉ cần chứng từ vào, dữ liệu sạch ra.

Bản đồ xu hướng

Ba năm trước, “OCR” nghĩa là nhận đúng ký tự. Năm nay, tín hiệu repo cho thấy trọng tâm đã dịch hẳn sang hiểu tài liệu: giữ bảng, giữ thứ tự đọc, giữ công thức, và quan trọng nhất là trả về cấu trúc mà LLM ăn được ngay. MinerU và Docling tự mô tả mình bằng đúng cụm từ “LLM-ready”, “ready for gen AI” — đó là định vị của cả làn sóng.

Đồng thời, chuỗi công cụ đang tách lớp rõ ràng. Có lớp thị giác nền (Surya lo OCR, bố cục, bảng), có lớp điều phối chuyển đổi (Marker, MinerU, Docling, anydoc), và có lớp trích xuất ngữ nghĩa (LangExtract, unstructured) biến văn bản thành trường dữ liệu. Với builder, tách lớp nghĩa là bạn không phải xây tất cả — bạn chọn mắt xích mình mạnh nhất rồi bán riêng mắt xích đó.

Một dịch chuyển ngầm khác: giấy phép rộng rãi. Phần lớn repo trong nhóm này dùng Apache-2.0 hoặc MIT, nghĩa là bạn được phép thương mại hoá, self-host, đóng gói lại. Đây là điều kiện cần để một dịch vụ “đọc chứng từ” của người Việt cạnh tranh được với API nước ngoài về giá và về chủ quyền dữ liệu.

Cụm công nghệ trong ngày

RAG & Data — lõi của cả bản tin

Đây là cụm chính hôm nay. Muốn có RAG tốt, dữ liệu đầu vào phải sạch: chunk đúng heading, giữ bảng, không nuốt mất số liệu. opendatalab/MinerU và docling-project/docling là hai “cửa ngõ” phổ biến nhất để biến PDF/Office thành Markdown/JSON cho pipeline. datalab-to/marker đi cùng hướng, nhấn mạnh tốc độ và độ chính xác khi xuất Markdown + JSON.

OCR & nhận dạng bố cục

PaddlePaddle/PaddleOCR là con quái vật về độ phổ dụng (100+ ngôn ngữ, có biến thể VLM), còn datalab-to/surya mạnh ở phân tích bố cục, thứ tự đọc và nhận diện bảng trên 90+ ngôn ngữ. Cả hai đều là lớp nền có thể cắm vào bất kỳ ứng dụng số hoá giấy tờ tiếng Việt nào.

Trích xuất ngữ nghĩa (text → dữ liệu)

Có chữ rồi vẫn chưa xong; phải rút được trường. google/langextract trích thông tin có cấu trúc từ văn bản lộn xộn bằng LLM và kèm source grounding — chỉ đúng vị trí nguồn của từng trường, cực giá trị cho nghiệp vụ không được phép đoán. Unstructured-IO/unstructured đóng vai ETL: gom mọi loại tài liệu về một định dạng sạch cho LLM.

Chuyển đổi định dạng nhẹ

firecrawl/anydoc viết bằng Rust, chuyển Word/PowerPoint/Excel/EPUB/PDF sang Markdown sạch, có binding Node và Python. Khi bạn chỉ cần “đổ tài liệu vào, lấy Markdown ra” trong một service nhẹ, đây là lựa chọn gọn.

Repo đáng chú ý

Mỗi repo dưới đây có trang phân tích riêng trong kho tri thức AIToEarn — bấm vào tên repo để đọc chi tiết ứng dụng, hướng kiếm tiền và link GitHub chính chủ.

PaddlePaddle/PaddleOCR

Bộ công cụ OCR nhẹ, mạnh của Baidu, hỗ trợ 100+ ngôn ngữ và biến ảnh/PDF thành dữ liệu có cấu trúc cho AI (⭐ 88.8k ghi nhận, Apache-2.0). Góc kiếm tiền: triển khai OCR on-premise cho khách cần bảo mật (y tế, tài chính), tính phí tích hợp + vận hành thay vì để họ phụ thuộc API ngoài.

opendatalab/MinerU

Biến tài liệu phức tạp (PDF, Office) thành Markdown/JSON sẵn sàng cho workflow agent (⭐ 77.4k ghi nhận, giấy phép dựa trên Apache-2.0). Góc kiếm tiền: dựng dịch vụ “số hoá kho tài liệu” cho doanh nghiệp truyền thống, tính theo số trang xử lý.

docling-project/docling

Dự án của IBM Research với khẩu hiệu “get your documents ready for gen AI” — chuẩn hoá tài liệu cho ứng dụng LLM (⭐ 66.2k ghi nhận, MIT). Góc kiếm tiền: làm lớp tiền xử lý cho các đội đang xây RAG nhưng đau đầu vì dữ liệu bẩn.

datalab-to/marker

Chuyển PDF sang Markdown + JSON nhanh với độ chính xác cao, giữ bảng và công thức (⭐ 39.6k ghi nhận, Apache-2.0). Góc kiếm tiền: đóng gói thành API “PDF → Markdown” tính theo trang cho team nội dung, kế toán, pháp chế.

google/langextract

Thư viện của Google trích thông tin có cấu trúc từ văn bản bằng LLM kèm source grounding và trực quan hoá (⭐ 37.3k ghi nhận, Apache-2.0). Góc kiếm tiền: bán giải pháp bóc tách chứng từ cho kế toán, bảo hiểm, ngân hàng — nơi kiểm chứng nguồn là bắt buộc.

datalab-to/surya

OCR + phân tích bố cục + thứ tự đọc + nhận diện bảng trên 90+ ngôn ngữ (⭐ 21.4k ghi nhận, Apache-2.0). Góc kiếm tiền: ghép Surya + LLM thành dịch vụ số hoá & tìm kiếm kho giấy tờ cho phòng công chứng, trường học.

Cơ hội triển khai

Xây gì: một dịch vụ “chứng từ vào — JSON ra” theo ngành hẹp. Ví dụ bóc hoá đơn GTGT tiếng Việt: OCR bằng PaddleOCR hoặc Surya, dựng cấu trúc bằng Marker/MinerU, rồi rút trường (mã số thuế, tổng tiền, ngày) bằng LangExtract có kiểm chứng nguồn. Đầu ra cắm thẳng vào phần mềm kế toán.

Bán cho ai: công ty dịch vụ kế toán, phòng công chứng, đại lý bảo hiểm, bộ phận nhân sự (bóc CV, bằng cấp), và các đội đang xây chatbot nội bộ nhưng thiếu lớp làm sạch dữ liệu. Mô hình tính phí theo trang hoặc theo tài liệu dễ giải thích và dễ chốt hơn phí thuê bao.

Đòn bẩy nội dung: gói kết quả thành một trang giới thiệu “trước–sau” (ảnh scan lộn xộn → bảng dữ liệu gọn) để bán bằng mắt. Tham khảo cách đóng gói dịch vụ tại Tổng hợp giải pháp và cách xác định ngách tại Phân tích ý tưởng.

Rủi ro cần theo dõi

Giấy phép và mô hình đi kèm: repo dùng Apache-2.0/MIT nhưng nhiều pipeline gọi thêm model VLM có giấy phép riêng — phải đọc kỹ điều khoản của trọng số model, không chỉ của code. MinerU dùng giấy phép riêng dựa trên Apache-2.0, cần rà trước khi thương mại hoá.

Chi phí và độ chính xác: tài liệu scan mờ, viết tay, dấu mộc đè chữ vẫn là điểm gãy. Đừng hứa 100%; hãy thiết kế bước con người kiểm tra các trường quan trọng và tính chi phí GPU cho khối lượng lớn.

Dữ liệu nhạy cảm và pháp lý: chứng từ tài chính, hồ sơ y tế, giấy tờ tuỳ thân là dữ liệu cá nhân. Ưu tiên self-host, mã hoá, và tuân thủ quy định bảo vệ dữ liệu — đây vừa là rủi ro vừa là lý do khách chọn giải pháp nội địa thay vì gửi dữ liệu ra API nước ngoài.

Danh sách đầy đủ

  • PaddlePaddle/PaddleOCR — OCR nhẹ, 100+ ngôn ngữ, ảnh/PDF → dữ liệu có cấu trúc — ⭐ 88.8k — RAG & Data
  • opendatalab/MinerU — tài liệu phức tạp → Markdown/JSON cho agent — ⭐ 77.4k — RAG & Data
  • docling-project/docling — chuẩn hoá tài liệu cho gen AI (IBM) — ⭐ 66.2k — RAG & Data
  • datalab-to/marker — PDF → Markdown + JSON nhanh, chính xác — ⭐ 39.6k — RAG & Data
  • google/langextract — trích trường có cấu trúc từ text, source grounding — ⭐ 37.3k — RAG & Data
  • datalab-to/surya — OCR + bố cục + bảng, 90+ ngôn ngữ — ⭐ 21.4k — RAG & Data
  • firecrawl/anydoc — Office/PDF/EPUB → Markdown sạch, viết bằng Rust — ⭐ 16.5k — RAG & Data
  • Unstructured-IO/unstructured — ETL tài liệu → dữ liệu sạch cho LLM — ⭐ 15.4k — RAG & Data

— Ban biên tập AIToEarn.

Bước tiếp theo

Biến điều vừa đọc thành hành động

Lưu bài để đọc lại, tạo kế hoạch 7 ngày hoặc mở playbook phù hợp.




route
Xem playbook liên quan
Đi từ kiến thức sang hướng triển khai phù hợp.