Nhận dạng chữ từ tệp PDF bản quét: chuẩn bị tệp thế nào và đọc chỉ số độ tin cậy ra sao
Công cụ nhận tệp PDF bản quét, dựng từng trang thành ảnh rồi chạy nhận dạng ký tự quang học bằng Tesseract.js ngay trong trình duyệt, trả về văn bản đã nhận diện kèm chỉ số độ tin cậy. Bạn chọn ngôn ngữ trong sáu tùy chọn có tiếng Việt và chọn định dạng xuất, số trang của mỗi tệp được đọc và hiển thị ngay khi thêm tệp.
Tính năng nổi bật
- Thêm nhiều tệp PDF cùng lúc bằng kéo thả hoặc hộp chọn tệp, tối đa 50MB mỗi tệp
- Đọc và hiển thị số trang của từng tệp ngay khi thêm vào danh sách
- Sáu tùy chọn ngôn ngữ gồm tự động phát hiện, tiếng Việt, tiếng Anh, tiếng Nhật, tiếng Hàn và tiếng Trung
- Bốn định dạng xuất gồm Word, Excel, văn bản thuần và PDF
- Hiển thị chỉ số độ tin cậy của kết quả nhận dạng kèm nhãn đánh giá theo ba mức
- Xử lý từng tệp độc lập, bấm nhận diện cho tệp nào thì tệp đó chạy
- Xóa riêng từng tệp hoặc xóa toàn bộ danh sách để làm lại
- Nút tải xuống riêng cho mỗi tệp sau khi nhận diện xong
Khi nào bạn thực sự cần nhận dạng ký tự quang học
Có hai loại tệp PDF trông giống hệt nhau trên màn hình nhưng khác nhau hoàn toàn về bản chất. Loại thứ nhất sinh ra từ phần mềm, chẳng hạn khi bạn xuất từ trình soạn thảo văn bản hay từ phần mềm kế toán; loại này đã có sẵn lớp chữ bên trong, bạn bôi đen được từng dòng và dùng chức năng tìm kiếm trong trình đọc PDF thì tìm thấy từ. Loại thứ hai sinh ra từ máy quét hoặc từ ảnh chụp, bên trong chỉ là một tấm ảnh nên bạn không bôi đen được gì và tìm kiếm không ra kết quả nào. Nhận dạng ký tự quang học chỉ dành cho loại thứ hai. Đây là điều nên kiểm tra trước tiên vì nó tiết kiệm rất nhiều thời gian: mở tệp, thử bôi đen một dòng chữ, nếu bôi được thì đừng dùng công cụ này mà hãy dùng công cụ chuyển PDF sang Word, kết quả sẽ chính xác tuyệt đối vì không có bước đoán chữ nào. Chỉ khi con trỏ trượt qua mà không chọn được chữ nào, bạn mới thực sự cần tới nhận dạng quang học.
Lợi ích khi sử dụng
- Lấy được nội dung chữ từ bản quét mà trước đó chỉ xem được chứ không sao chép được
- Chọn được ngôn ngữ nhận diện nên tài liệu tiếng Việt có dấu cho kết quả tốt hơn để mặc định
- Chỉ số độ tin cậy cho biết ngay kết quả có đáng tin hay cần quét lại tài liệu
- Thêm nhiều tệp vào danh sách rồi xử lý lần lượt, không phải làm lại từ đầu mỗi lần
- Không cần cài phần mềm nhận dạng chữ vốn khá nặng và thường tính phí
Cách nhận dạng chữ từ tệp PDF
- 1Chọn ngôn ngữ nhận diện trước, nếu tài liệu thuần tiếng Việt hãy chọn thẳng tiếng Việt thay vì để chế độ tự động.
- 2Chọn định dạng xuất phù hợp, chọn văn bản thuần nếu bạn định tự định dạng lại sau.
- 3Kéo thả tệp PDF vào vùng nhận hoặc bấm để chọn, mỗi tệp tối đa 50MB.
- 4Đối chiếu số trang hiển thị bên cạnh tên tệp để chắc chắn đã chọn đúng tài liệu.
- 5Bấm Nhận diện cho từng tệp, chờ xử lý xong rồi đọc chỉ số độ tin cậy trước khi bấm Tải xuống.
Chất lượng bản quét quyết định gần như toàn bộ kết quả
Nhận dạng ký tự quang học hoạt động bằng cách tách từng hình dạng chữ ra khỏi nền rồi so khớp với mô hình đã học. Vì vậy mọi thứ làm nhòe ranh giới giữa chữ và nền đều kéo độ chính xác xuống. Mốc kỹ thuật quan trọng nhất là độ phân giải: chuẩn thường được khuyến nghị là 300 điểm ảnh trên mỗi inch, tương đương một trang A4 phải có khoảng 2.480 nhân 3.508 điểm ảnh. Dưới mốc đó, các nét mảnh của chữ chỉ còn một vài điểm ảnh và mô hình bắt đầu đoán sai; trên mốc đó thì cải thiện không đáng kể trong khi tệp nặng thêm rất nhiều. Yếu tố thứ hai là độ nghiêng: chỉ cần lệch khoảng hai độ là tỷ lệ sai đã tăng rõ, nên hãy đặt giấy thẳng khi quét hoặc nắn lại trước. Yếu tố thứ ba là độ tương phản và bóng đổ; nền giấy ngả vàng hoặc một góc trang bị tối do bóng người chụp là hai nguyên nhân phổ biến khiến cả một vùng chữ bị bỏ qua. Nếu bạn xuất phát từ ảnh chụp bằng điện thoại, hãy xử lý ảnh qua công cụ tạo bản quét để đẩy tương phản và làm sạch nền trước khi tạo tệp PDF.
Đọc chỉ số độ tin cậy và biết khi nào phải làm lại
Sau khi xử lý xong, mỗi tệp hiển thị một con số phần trăm kèm nhãn đánh giá theo ba mức: từ 90 trở lên là rất tốt, từ 70 tới 89 là tốt, dưới 70 là trung bình. Con số này là mức độ chắc chắn trung bình của mô hình về những gì nó đọc được, không phải tỷ lệ chữ đúng, nên đừng hiểu 95 phần trăm nghĩa là chỉ sai 5 phần trăm số chữ. Cách dùng đúng là coi nó như tín hiệu cảnh báo. Từ 90 trở lên, bạn vẫn nên đọc soát nhưng có thể tin phần lớn nội dung. Từ 70 tới 89, hãy soát kỹ các con số, tên riêng và mã số vì đây là nhóm dễ sai nhất và cũng là nhóm gây hậu quả nặng nhất khi sai. Dưới 70, đừng mất công sửa mà hãy quay lại khâu chuẩn bị tệp: quét lại ở độ phân giải cao hơn, nắn thẳng trang, tăng tương phản. Kinh nghiệm là thời gian bỏ ra để quét lại một trang cho tử tế luôn ít hơn thời gian dò sửa một bản nhận dạng tồi, đặc biệt với tài liệu có nhiều số liệu.
Vì sao tiếng Việt khó nhận dạng hơn và chọn ngôn ngữ thế nào
Bảng chữ cái tiếng Việt có 134 tổ hợp chữ và dấu, trong đó nhiều tổ hợp chỉ khác nhau ở một nét rất nhỏ đặt phía trên hoặc phía dưới chữ. Ở độ phân giải thấp, dấu ngã và dấu hỏi trông gần như giống nhau, dấu mũ trong ê dễ lẫn với dấu sắc, và cái móc nhỏ phân biệt ơ với o hay ư với u nhiều khi chỉ chiếm một hai điểm ảnh. Đây là lý do cùng một máy quét, cùng một trang giấy, bản tiếng Anh cho kết quả gần như hoàn hảo trong khi bản tiếng Việt vẫn còn lỗi rải rác. Về lựa chọn, nếu tài liệu thuần tiếng Việt hãy chọn thẳng tiếng Việt thay vì để chế độ tự động, vì chế độ tự động chạy kết hợp cả tiếng Anh lẫn tiếng Việt và điều đó khiến mô hình phải cân nhắc thêm nhiều khả năng, đôi khi làm kết quả kém đi ở những từ ngắn. Ngược lại, với tài liệu kỹ thuật hay hợp đồng có xen nhiều thuật ngữ tiếng Anh thì chế độ tự động lại hợp lý. Với tài liệu tiếng Nhật, tiếng Hàn hay tiếng Trung, bắt buộc phải chọn đúng ngôn ngữ vì hệ chữ hoàn toàn khác.
Định dạng xuất và những gì bạn vẫn phải làm bằng tay
Cần nói rõ để bạn khỏi mất thời gian tìm kiếm một tính năng không có. Kết quả nhận dạng là một dòng chữ liên tục theo thứ tự đọc, và các định dạng xuất khác nhau chủ yếu ở phần vỏ tệp chứ chưa dựng lại bố cục gốc. Cụ thể, bản xuất Word chứa nội dung chữ nhưng không giữ được kiểu chữ, cỡ chữ, căn lề, tiêu đề hay bảng biểu như trong bản quét, nên bạn vẫn phải định dạng lại. Bản xuất Excel không tự tách cột thành từng ô, nên với bảng số liệu bạn sẽ cần dùng chức năng tách văn bản thành cột trong bảng tính rồi chỉnh tay. Bản xuất PDF không tạo ra lớp chữ ẩn phía sau ảnh gốc theo kiểu tệp PDF tìm kiếm được đúng nghĩa. Bản xuất văn bản thuần là dạng trung thực nhất với những gì thực sự nhận được, và trong nhiều tình huống nó lại tiện nhất vì bạn dán vào đâu cũng được rồi tự định dạng. Lời khuyên thực dụng: chọn văn bản thuần, dán vào công cụ soạn thảo quen thuộc và định dạng lại ở đó, thay vì kỳ vọng nhận về một tệp dùng ngay.
Giới hạn của công cụ và cách xử lý khi kết quả không như mong đợi
Có hai giới hạn bạn nên biết trước. Thứ nhất, việc dựng ảnh từng trang và chạy nhận dạng đều thực hiện trong trình duyệt của bạn, tệp PDF không được tải lên máy chủ, nhưng chính vì vậy toàn bộ gánh nặng xử lý dồn lên máy của bạn: tệp nhiều trang hoặc máy cấu hình thấp sẽ chạy chậm, có lúc tab trình duyệt tạm treo trong lúc dựng ảnh độ phân giải cao cho từng trang. Thứ hai, mỗi tệp giới hạn 50MB; tệp rất dày hàng trăm trang có thể khiến trình duyệt hết bộ nhớ giữa chừng, khi đó hãy tách thành nhiều tệp nhỏ hơn rồi chạy lần lượt. Bộ nhận dạng làm việc trên ảnh từng trang nên tệp PDF nào là bản quét chữ rõ nét sẽ cho kết quả tốt nhất; trang nào ảnh mờ, nghiêng hay độ phân giải thấp vẫn nhận dạng kém dù công cụ đã tự dựng ảnh đúng cách. Nếu một trang cụ thể ra kết quả tệ, cách chắc chắn nhất là tách riêng trang đó bằng công cụ chuyển PDF sang ảnh với độ phân giải cao hơn, rồi đưa ảnh đó qua công cụ nhận dạng chữ từ ảnh để kiểm tra riêng.
Câu hỏi thường gặp (FAQ)
Làm sao biết tệp PDF của tôi có cần nhận dạng ký tự quang học không?
Mở tệp rồi thử bôi đen một dòng chữ. Nếu bôi được và chức năng tìm kiếm trong trình đọc tìm ra từ, tệp đã có sẵn lớp chữ và bạn nên dùng công cụ chuyển PDF sang Word để có kết quả chính xác tuyệt đối. Chỉ khi không chọn được chữ nào bạn mới cần tới nhận dạng quang học.
Bản quét cần độ phân giải bao nhiêu để nhận dạng tốt?
Mốc khuyến nghị là 300 điểm ảnh trên mỗi inch, tương đương khoảng 2.480 nhân 3.508 điểm ảnh cho một trang A4. Dưới mốc này các nét mảnh của chữ chỉ còn vài điểm ảnh và mô hình bắt đầu đoán sai, đặc biệt với dấu thanh tiếng Việt. Trên mốc này thì cải thiện không đáng kể mà tệp nặng thêm nhiều.
Chỉ số độ tin cậy 85 phần trăm nghĩa là sai 15 phần trăm số chữ à?
Không. Đó là mức độ chắc chắn trung bình của mô hình về những gì nó đọc được, không phải tỷ lệ chữ đúng. Hãy dùng nó như tín hiệu: từ 90 trở lên thì tin được phần lớn, từ 70 tới 89 thì soát kỹ số liệu và tên riêng, dưới 70 thì nên quét lại tài liệu.
Vì sao tiếng Việt nhận dạng sai nhiều hơn tiếng Anh?
Vì tiếng Việt có 134 tổ hợp chữ và dấu, nhiều tổ hợp chỉ khác nhau ở một nét rất nhỏ. Ở độ phân giải thấp, dấu ngã và dấu hỏi trông gần giống nhau, còn cái móc phân biệt ơ với o có khi chỉ chiếm một hai điểm ảnh. Chọn đúng ngôn ngữ tiếng Việt và quét ở 300 điểm ảnh trên inch là hai cách cải thiện rõ nhất.
Nên chọn chế độ tự động phát hiện hay chọn thẳng ngôn ngữ?
Với tài liệu thuần tiếng Việt, hãy chọn thẳng tiếng Việt vì chế độ tự động chạy kết hợp cả tiếng Anh lẫn tiếng Việt và điều đó có thể làm kết quả kém đi ở những từ ngắn. Chế độ tự động phù hợp hơn với tài liệu kỹ thuật hay hợp đồng xen nhiều thuật ngữ tiếng Anh.
Bản xuất Word có giữ nguyên định dạng và bảng biểu không?
Không. Kết quả là chuỗi chữ theo thứ tự đọc, chưa dựng lại kiểu chữ, căn lề hay bảng biểu của bản gốc. Với bảng số liệu, bản xuất Excel cũng không tự tách thành từng ô. Cách thực dụng là chọn văn bản thuần rồi tự định dạng lại trong công cụ soạn thảo quen thuộc của bạn.
Tệp của tôi có được gửi lên máy chủ không?
Không. Việc dựng ảnh từng trang và chạy nhận dạng ký tự quang học đều thực hiện bằng JavaScript ngay trong trình duyệt của bạn, tệp không rời khỏi máy. Đổi lại, máy của bạn phải tự gánh phần tính toán, nên tệp nhiều trang có thể chạy chậm hơn so với xử lý trên máy chủ.
Giới hạn dung lượng và số trang là bao nhiêu?
Mỗi tệp tối đa 50MB. Vì xử lý chạy trong trình duyệt, giới hạn thật sự phụ thuộc vào bộ nhớ của máy bạn hơn là một mốc thời gian cố định; tài liệu rất dày hàng trăm trang có thể khiến trình duyệt hết bộ nhớ giữa chừng. Với tập hồ sơ dày, hãy tách thành nhiều tệp nhỏ rồi xử lý lần lượt, cách này cũng giúp bạn dễ phát hiện trang nào bị lỗi.
Kết quả trả về thiếu nội dung so với tệp gốc thì làm sao?
Công cụ xử lý lần lượt từng trang nên về nguyên tắc sẽ không bỏ sót trang nào, trừ khi cả quá trình bị lỗi giữa chừng, khi đó bạn sẽ thấy trạng thái báo lỗi thay vì kết quả một phần. Nếu kết quả đủ trang nhưng thiếu chữ trong một trang cụ thể, nguyên nhân thường là ảnh trang đó mờ hoặc nghiêng. Cách kiểm tra là tách riêng trang đó thành ảnh bằng công cụ chuyển PDF sang ảnh với độ phân giải cao hơn, rồi đưa ảnh đó qua công cụ nhận dạng chữ từ ảnh để so sánh.
Ảnh chụp tài liệu bằng điện thoại có dùng được không?
Dùng được nhưng nên xử lý trước. Ảnh chụp thường có bóng đổ, nền ngả vàng và hơi nghiêng, ba yếu tố kéo độ chính xác xuống mạnh. Hãy đưa ảnh qua công cụ tạo bản quét để đẩy tương phản và làm sạch nền, sau đó mới chuyển thành tệp PDF và nhận dạng.
Nhận dạng được chữ viết tay không?
Rất hạn chế. Bộ nhận dạng được huấn luyện chủ yếu trên chữ in, nên chữ viết tay cho kết quả kém, đặc biệt với tiếng Việt có dấu. Với biểu mẫu viết tay, cách thực tế hơn vẫn là nhập liệu thủ công hoặc dùng dịch vụ chuyên biệt cho chữ viết tay.
Có xử lý hàng loạt tệp cùng lúc được không?
Bạn thêm được nhiều tệp vào danh sách nhưng phải bấm nhận diện cho từng tệp một. Cách này có lợi vì bạn kiểm soát được thứ tự và biết ngay tệp nào có vấn đề, thay vì chạy hàng loạt rồi không rõ lỗi nằm ở đâu.
Từ khóa liên quan
- ocr pdf online
- chuyển pdf scan sang text
- nhận dạng chữ từ pdf
- ocr tiếng việt online
- pdf không copy được chữ
- chuyển bản scan thành văn bản
- ocr hợp đồng scan
- trích xuất chữ từ file pdf
- pdf ocr miễn phí
- nhận dạng ký tự quang học là gì
- quét tài liệu 300 dpi
- ocr sai dấu tiếng việt
- chuyển pdf scan sang word
- độ chính xác ocr
- ocr chữ viết tay
- xử lý ảnh trước khi ocr
- pdf tìm kiếm được là gì
- số hóa tài liệu giấy
- trích xuất số liệu từ bảng scan
- công cụ ocr trực tuyến tiếng việt