Chuyển PDF sang Markdown: cách công cụ đoán cấu trúc và bạn cần soát lại gì
Công cụ trích văn bản từng trang của tệp PDF rồi dựng lại cấu trúc theo cỡ chữ và tọa độ: tiêu đề nhiều cấp, đoạn văn, danh sách có dấu đầu dòng và danh sách đánh số, khối mã theo phông đơn cách. Dòng bị ngắt giữa câu được nối lại, mỗi trang cách nhau bằng đường kẻ ngang, toàn bộ chạy trong trình duyệt.
Tính năng nổi bật
- Trích văn bản theo từng trang và giữ đúng thứ tự đọc dựa trên tọa độ của từng mẩu chữ
- Nhận dạng tiêu đề bốn cấp bằng cách so cỡ chữ của dòng với cỡ chữ thân bài
- Chuyển danh sách có dấu đầu dòng và danh sách đánh số sang cú pháp Markdown tương ứng
- Bọc các dòng dùng phông đơn cách thành khối mã ba dấu huyền
- Nối các dòng bị ngắt giữa câu và ghép lại từ bị cắt đôi bởi dấu gạch nối cuối dòng
- Loại bỏ tiêu đề chạy và số trang lặp lại ở đầu hoặc cuối mọi trang
- Tách trang bằng đường kẻ ngang để bạn dò lại đúng vị trí trong tệp gốc
- Cảnh báo ngay khi tệp không có lớp văn bản và chỉ sang công cụ nhận dạng ký tự
Vì sao lấy nội dung PDF về dạng Markdown thay vì dạng tệp soạn thảo
Markdown là chữ thuần cộng thêm vài quy ước đánh dấu rất gọn: dấu thăng cho tiêu đề, dấu gạch ngang cho danh sách, ba dấu huyền cho khối mã. Vì là chữ thuần nên tệp kết quả nhẹ, mở được bằng bất cứ trình soạn thảo nào, so sánh được từng dòng bằng công cụ quản lý mã nguồn, và dán thẳng vào các công cụ ghi chú hay hệ thống quản lý nội dung mà không kéo theo phông chữ hay định dạng lạ. Đó là ba việc mà tệp soạn thảo văn bản làm rất kém: tệp nặng, mở ra mỗi máy một kiểu, và khi so sánh hai phiên bản thì công cụ báo khác biệt ở cả những chỗ chỉ đổi định dạng. Ngoài ra, Markdown đang là định dạng đầu vào quen thuộc nhất cho các hệ thống xử lý ngôn ngữ và các kho tài liệu kỹ thuật, nên khi bạn cần đưa một chồng PDF vào kho kiến thức nội bộ hay vào công cụ tìm kiếm ngữ nghĩa, chuyển sang Markdown là bước chuẩn bị hợp lý hơn nhiều so với chuyển sang tệp soạn thảo rồi lại phải bóc định dạng ra.
Lợi ích khi sử dụng
- Hợp đồng, báo cáo, tài liệu nội bộ không rời khỏi máy bạn trong suốt quá trình chuyển đổi
- Kết quả là chữ thuần nên nhẹ, mở được ở mọi nơi và so sánh phiên bản được
- Nhận dạng cấu trúc tự động nên đỡ phải tự gõ lại dấu thăng cho từng tiêu đề
- Nhìn thấy ngay số tiêu đề, số mục danh sách và số khối mã đã nhận ra để đánh giá chất lượng
- Biết ngay tệp có phải bản quét hay không thay vì chờ xong mới phát hiện kết quả rỗng
- Không giới hạn số lần dùng và không yêu cầu đăng ký tài khoản
Các bước chuyển PDF sang Markdown
- 1Kéo thả tệp PDF vào vùng nhận, tệp phải có lớp văn bản chứ không phải bản quét thuần ảnh.
- 2Với tài liệu dài, nhập số trang giới hạn để thử vài trang đầu trước khi chạy toàn bộ.
- 3Bật tắt các công tắc nhận dạng tiêu đề, nối dòng, khối mã và bỏ tiêu đề chạy cho hợp với tài liệu.
- 4Bấm chuyển sang Markdown và theo dõi tiến độ trích văn bản theo từng trang.
- 5Đọc lại kết quả trong khung bên phải, chỉnh tay những chỗ đoán sai rồi chép hoặc tải tệp .md về.
Công cụ đoán cấu trúc bằng cách nào
Bên trong tệp PDF không có khái niệm tiêu đề hay đoạn văn. Thứ thật sự được lưu là hàng nghìn mẩu chữ, mỗi mẩu kèm tọa độ đặt trên trang, cỡ chữ và tên phông. Vì vậy mọi công cụ chuyển sang Markdown đều phải suy luận ngược từ hình thức về cấu trúc, và công cụ này làm theo bốn bước. Bước một, gom các mẩu chữ có cùng độ cao trên trang thành một dòng, rồi sắp xếp các mẩu trong dòng theo hoành độ tăng dần; khoảng cách giữa hai mẩu lớn hơn một phần tư cỡ chữ được coi là dấu cách. Bước hai, tính cỡ chữ thân bài bằng cách lấy cỡ chữ chiếm nhiều ký tự nhất trong toàn tài liệu, đây là mốc để so sánh. Bước ba, dòng nào có cỡ chữ lớn hơn thân bài từ chín phần trăm trở lên thì được coi là tiêu đề, và mức độ lớn hơn quyết định cấp một, hai, ba hay bốn. Bước bốn, kiểm tra phần đầu dòng để bắt các ký tự đầu mục và các số thứ tự có dấu chấm hoặc ngoặc đóng phía sau. Đây là suy luận theo xác suất chứ không phải đọc ra cấu trúc có sẵn, nên kết quả cần được soát lại.
Nối dòng bị ngắt: quy tắc và những chỗ dễ sai
Trong PDF, một đoạn văn được xuống dòng bằng cách đặt các mẩu chữ ở những độ cao khác nhau chứ không có ký hiệu ngắt đoạn nào. Nếu giữ nguyên, bạn sẽ nhận về một khối chữ mà mỗi dòng in trên giấy thành một dòng riêng trong Markdown, và khi hiển thị lại thì đoạn văn vỡ vụn. Công cụ nối các dòng thuộc cùng một đoạn theo ba quy tắc. Thứ nhất, nếu khoảng cách dọc giữa hai dòng lớn hơn khoảng một lần rưỡi chiều cao dòng thì coi là sang đoạn mới. Thứ hai, nếu dòng trước kết thúc bằng dấu chấm, chấm hỏi, chấm than hoặc hai chấm và dòng đó ngắn hơn hẳn bề ngang thông thường thì coi là hết đoạn. Thứ ba, nếu dòng trước kết thúc bằng dấu gạch nối thì đó là một từ bị cắt đôi, công cụ bỏ dấu gạch và ghép liền hai phần. Quy tắc thứ ba là quy tắc dễ gây lỗi nhất với tiếng Việt, vì tiếng Việt hiếm khi ngắt từ bằng gạch nối nhưng lại dùng gạch nối trong tên riêng và trong các cụm ghép, nên nếu tài liệu của bạn nhiều tên riêng có gạch nối thì hãy soát kỹ chỗ giao giữa hai dòng.
Bảng biểu, hình ảnh và những gì công cụ không làm được
Cần nói rõ giới hạn để bạn không mất thời gian tìm một tùy chọn không tồn tại. Bảng biểu không được dựng lại thành bảng Markdown. Lý do là trong PDF, một bảng chỉ là các mẩu chữ đặt theo lưới tọa độ cộng với vài đường kẻ vẽ riêng, và việc suy ra ranh giới cột từ tọa độ là bài toán khó, sai một chút là cả bảng lệch. Kết quả bạn nhận được sẽ là các dòng chữ theo thứ tự đọc, ô cách nhau bằng dấu cách. Nếu tài liệu của bạn chủ yếu là bảng số liệu, hãy dùng công cụ chuyển PDF sang Excel thay vì công cụ này. Hình ảnh cũng không được trích ra vì Markdown chỉ tham chiếu tới tệp ảnh bên ngoài chứ không nhúng được ảnh; nếu bạn cần cả ảnh, hãy dùng công cụ chuyển PDF sang ảnh để xuất từng trang rồi tự chèn tham chiếu vào tệp Markdown. Ngoài ra, chữ in đậm và in nghiêng không được đánh dấu lại, vì thông tin về kiểu chữ nằm trong tên phông nhúng mà tên phông trong tệp PDF thường bị mã hóa thành chuỗi vô nghĩa nên không suy ra được một cách đáng tin.
Cặp công cụ hai chiều với Markdown to PDF
Trên trang này có sẵn công cụ chuyển Markdown sang PDF, và công cụ hiện tại là chiều ngược lại của nó. Hai chiều phục vụ hai nhu cầu khác hẳn nhau. Chiều xuôi dùng khi bạn viết tài liệu bằng Markdown vì tốc độ và vì dễ quản lý phiên bản, rồi cần một bản trình bày đẹp để gửi khách hàng hoặc để in; khi đó bạn xuất ra PDF và người nhận thấy một tài liệu định dạng chỉn chu. Chiều ngược dùng khi bạn nhận về một tệp PDF và cần lấy nội dung ra để chỉnh sửa, trích dẫn, dịch, đưa vào kho tài liệu hoặc đưa vào một hệ thống xử lý tự động. Điều quan trọng cần hiểu là hai chiều này không khép kín: xuất Markdown ra PDF rồi đọc ngược lại sẽ không cho ra đúng tệp Markdown ban đầu, vì bước xuất đã biến cấu trúc thành hình thức và bước đọc ngược chỉ đoán lại cấu trúc từ hình thức đó. Bảng biểu, ảnh, liên kết và phần đánh dấu in đậm sẽ mất. Vì vậy hãy luôn giữ tệp Markdown gốc làm bản chính, coi PDF là bản phân phối.
Nhận biết và xử lý tệp PDF dạng ảnh quét
Có hai loại tệp PDF trông giống hệt nhau trên màn hình. Loại sinh ra từ phần mềm đã có sẵn lớp chữ bên trong: bạn bôi đen được từng dòng và chức năng tìm kiếm trong trình đọc tìm ra từ. Loại sinh ra từ máy quét hoặc ảnh chụp thì bên trong chỉ là một tấm ảnh, con trỏ trượt qua mà không chọn được gì. Công cụ này chỉ làm việc với loại thứ nhất, vì nó đọc lớp chữ chứ không nhận dạng hình ảnh. Khi tổng số ký tự trích được quá thấp so với số trang, công cụ hiện cảnh báo ngay thay vì để bạn nhận về một kết quả gần như trống rồi tự đoán lý do. Cách xử lý cho loại thứ hai là chạy công cụ nhận dạng ký tự quang học trước để tạo ra lớp chữ, sau đó mới quay lại đây để dựng cấu trúc. Lưu ý là kết quả nhận dạng với tài liệu tiếng Việt cần soát kỹ phần dấu thanh, và bản quét nên có độ phân giải khoảng ba trăm điểm ảnh trên mỗi inch thì tỷ lệ đọc đúng mới cao. Ngoài ra, có những tệp lai gồm vài trang chữ thật xen vài trang quét, khi đó kết quả sẽ thiếu đúng những trang quét.
Câu hỏi thường gặp (FAQ)
Kết quả chuyển ra trống hoặc chỉ có vài ký tự, vì sao?
Gần như chắc chắn tệp của bạn là bản quét hoặc ảnh chụp lưu thành PDF, bên trong không có lớp chữ nào để trích. Hãy thử bôi đen một dòng trong trình đọc PDF: nếu không chọn được chữ thì đúng là trường hợp này. Cách xử lý là chạy công cụ nhận dạng ký tự quang học trước rồi quay lại đây.
Công cụ có dựng lại bảng biểu thành bảng Markdown không?
Không. Trong PDF, bảng chỉ là các mẩu chữ đặt theo lưới tọa độ cộng vài đường kẻ vẽ riêng, việc suy ra ranh giới cột rất dễ sai. Bạn sẽ nhận được các dòng chữ theo thứ tự đọc, ô cách nhau bằng dấu cách. Nếu tài liệu chủ yếu là bảng số liệu, hãy dùng công cụ chuyển PDF sang Excel.
Vì sao một số tiêu đề bị nhận nhầm thành đoạn văn hoặc ngược lại?
Vì công cụ nhận dạng tiêu đề bằng cỡ chữ. Tài liệu dùng tiêu đề cùng cỡ với thân bài nhưng chỉ in đậm thì công cụ không phân biệt được, còn dòng thân bài nào vô tình dùng cỡ lớn hơn thì có thể bị nâng thành tiêu đề. Bạn có thể tắt công tắc nhận dạng tiêu đề rồi tự đánh dấu, hoặc chỉnh tay vài chỗ sau khi chuyển.
Chữ in đậm và in nghiêng có được giữ lại không?
Không. Thông tin về kiểu chữ nằm trong tên phông nhúng, mà tên phông trong tệp PDF thường bị mã hóa thành chuỗi vô nghĩa nên không suy ra được một cách đáng tin. Nếu đánh dấu sai, kết quả còn khó đọc hơn là không đánh dấu, nên công cụ chọn cách bỏ qua và để bạn tự thêm chỗ nào thực sự cần.
Hình ảnh trong PDF có được trích ra không?
Không, vì Markdown chỉ tham chiếu tới tệp ảnh bên ngoài chứ không nhúng ảnh vào trong. Nếu bạn cần cả hình, hãy dùng công cụ chuyển PDF sang ảnh để xuất từng trang thành tệp ảnh riêng, lưu vào cùng thư mục với tệp Markdown rồi tự chèn dòng tham chiếu ảnh vào đúng vị trí.
Vì sao đoạn văn bị vỡ thành nhiều dòng rời rạc?
Hãy kiểm tra công tắc nối dòng bị ngắt giữa câu, nếu tắt thì mỗi dòng in trên giấy thành một dòng riêng. Nếu đã bật mà vẫn vỡ, thường là do tài liệu có giãn dòng rất rộng khiến công cụ hiểu nhầm là sang đoạn mới, hoặc do văn bản chia hai cột khiến thứ tự đọc bị xáo trộn.
Tài liệu hai cột xử lý ra sao?
Kết quả thường bị trộn lẫn hai cột vì công cụ gom các mẩu chữ theo cùng độ cao trên trang, mà hai cột thì cùng độ cao lại thuộc hai mạch nội dung khác nhau. Với tài liệu học thuật hoặc tạp chí in hai cột, cách thực tế là cắt tệp thành từng phần bằng công cụ tách PDF rồi soát lại thứ tự bằng tay sau khi chuyển.
Tiêu đề chạy và số trang bị lẫn vào nội dung thì làm sao?
Bật công tắc bỏ tiêu đề chạy và số trang lặp lại. Công cụ đối chiếu dòng đầu và dòng cuối của mọi trang, dòng nào xuất hiện ở ít nhất sáu phần mười số trang thì bị loại, đồng thời loại luôn những dòng chỉ gồm một con số hoặc dạng số trên tổng. Cách này cần tài liệu có từ ba trang trở lên mới hoạt động.
Khối mã được nhận dạng bằng cách nào?
Bằng phông chữ. Dòng nào có toàn bộ mẩu chữ dùng phông đơn cách như Courier hay Consolas thì được bọc vào khối mã ba dấu huyền. Vì vậy tài liệu kỹ thuật trình bày mã bằng phông đơn cách sẽ ra đúng, còn tài liệu chèn mã bằng phông thường thì công cụ không nhận ra và bạn phải tự bọc lại.
Chuyển Markdown ra PDF rồi đọc ngược lại có ra đúng tệp ban đầu không?
Không. Bước xuất đã biến cấu trúc thành hình thức, còn bước đọc ngược chỉ đoán lại cấu trúc từ hình thức đó. Bảng biểu, ảnh, liên kết và phần đánh dấu in đậm sẽ mất. Hãy luôn giữ tệp Markdown gốc làm bản chính và coi PDF là bản để phân phối.
Tài liệu vài trăm trang có xử lý được không?
Được nhưng chậm, vì công cụ phải đọc lớp văn bản của từng trang rồi mới dựng cấu trúc, và toàn bộ chạy trên máy bạn. Hãy dùng ô giới hạn số trang để thử mười trang đầu, kiểm tra cách nhận dạng cấu trúc có hợp với tài liệu không, chỉnh các công tắc rồi mới chạy toàn bộ để đỡ mất công làm lại.
Tệp của tôi có được gửi lên máy chủ không?
Không. Toàn bộ việc đọc tệp, trích văn bản và dựng Markdown chạy bằng mã trong trình duyệt của bạn. Không có bước tải lên nào nên hợp đồng, báo cáo tài chính hay tài liệu nội bộ không rời khỏi máy. Đổi lại, tốc độ phụ thuộc cấu hình máy bạn và máy yếu có thể chậm với tệp rất lớn.
Từ khóa liên quan
- chuyển pdf sang markdown
- pdf to markdown online
- trích văn bản từ pdf
- pdf sang text giữ cấu trúc
- chuyển pdf sang md
- lấy nội dung từ file pdf
- pdf to markdown tiếng việt
- chuyển tài liệu pdf sang ghi chú
- markdown to pdf chiều ngược
- trích tiêu đề từ pdf
- pdf sang markdown miễn phí
- chuẩn bị dữ liệu pdf cho ai
- pdf scan không trích được chữ
- công cụ pdf không upload file
- chuyển pdf sang chữ thuần
- pdf hai cột trích văn bản
- trích khối mã từ tài liệu pdf
- chuyển ebook pdf sang markdown
- convert pdf to markdown free
- đưa pdf vào kho tài liệu nội bộ
