Tesseract OCR (offline) + Mistral Vision

Nhận diện & liệt kê Số CCCD
áp dụng cho MẪU 01-MỞ TÀI KHOẢN

Tải lên file PDF hồ sơ gộp nhiều văn bản. Công cụ quét OCR offline một vùng cố định (nơi in "Số: ...") trước — chỉ khi OCR không đọc chắc chắn mới gọi Mistral AI, giúp tiết kiệm token. Số hiệu văn bản (vd "060089013557" từ "Số GTTT") của mỗi văn bản sẽ được liệt kê thành danh sách theo đúng thứ tự từ trên xuống (theo thứ tự trang trong file), không chỉnh sửa gì lên file PDF gốc — bạn có thể tải danh sách này ra file Excel (.xlsx) hoặc CSV.

AOCR Tesseract (offline, tiết kiệm token)

Đây là trang HTML chạy trong trình duyệt nên không thể gọi trực tiếp bản Tesseract-OCR đã cài ở C:\Program Files\Tesseract-OCR (trình duyệt không được phép chạy chương trình ngoài vì lý do bảo mật). Thay vào đó công cụ dùng Tesseract.js — cùng lõi nhận dạng Tesseract nhưng chạy hoàn toàn cục bộ trong trình duyệt (WebAssembly), vẫn 100% offline/miễn phí, không gửi ảnh lên đâu cả. Nếu bạn thật sự cần gọi đúng bản .exe đã cài, cần một công cụ desktop (Python/Node) thay vì trang HTML — báo mình nếu muốn bản đó.
Càng cao càng rõ chữ số nhưng càng chậm.
Dưới ngưỡng này → coi là "không chắc" → dùng Mistral (nếu chế độ hybrid).
Nếu bạn đã biết chắc quy luật phân trang (vd file 50 trang, mỗi văn bản luôn 6 trang → trang bắt đầu là 1, 7, 13, 19...), chọn chế độ thủ công: công cụ sẽ chỉ quét OCR/Mistral đúng các trang bắt đầu đó để đọc số hiệu, nhanh và tiết kiệm hơn nhiều so với quét toàn bộ trang.
Tải PDF ở mục B trước, sau đó kéo/thả và kéo góc dưới-phải của khung xanh để khoanh đúng vùng in "Số: ..." trên trang 1 — vùng này sẽ được áp dụng cho mọi trang.
vùng quét "Số:"

BFile PDF & Mistral API Key

Kéo-thả file PDF vào đây, hoặc bấm để chọn file
Key chỉ lưu trong bộ nhớ trình duyệt, gửi trực tiếp đến api.mistral.ai. Không cần nhập nếu dùng chế độ "Chỉ OCR".
Chỉ áp dụng cho trang thực sự gọi Mistral.

✓Tiến trình

Đang chờ...

↓Kết quả

#TrangSố văn bảnSố hiệu đầy đủNguồnTiêu đề