Sửa lỗi copy từ PDF sang Word bị xuống dòng giữa câu
Khi copy từ PDF sang Word, mỗi dòng trên trang PDF thường trở thành một đoạn riêng, câu bị cắt ngang, số trang và tiêu đề đầu trang chen vào giữa nội dung. Công cụ nối dòng văn bản này đọc từng chỗ xuống dòng, nối lại những chỗ bị ngắt giữa câu, giữ nguyên chỗ hết đoạn thật, gạch đầu dòng và mục đánh số, đồng thời bỏ số trang, dòng lặp lại ở đầu và chân trang cùng các ký tự vô hình. Mọi xử lý chạy trên trình duyệt của bạn.
Tính năng nổi bật
- Nối các dòng bị ngắt giữa câu, giữ chỗ xuống đoạn thật dựa trên dấu câu cuối dòng, chữ hoa chữ thường ở đầu dòng sau và độ dài dòng
- Giữ nguyên gạch đầu dòng (-, •, *), mục đánh số (1., 2), a), I.) và dòng mở đầu bằng Điều, Chương, Mục
- Bỏ gạch nối cuối dòng của tiếng Anh (inter- / national thành international), giữ gạch nối khi dòng sau viết hoa hoặc là số như COVID-19
- Bỏ dòng số trang: 3, - 3 -, Trang 3, Trang 3/10, Page 3 of 10, số La Mã chữ thường
- Tự tìm tiêu đề đầu trang, chân trang lặp lại từ 3 lần trở lên và cho bạn chọn giữ lại dòng nào
- Chuẩn hóa Unicode NFC, đổi khoảng trắng không ngắt (NBSP) thành khoảng trắng thường, bỏ ký tự rộng bằng không và gạch mềm (soft hyphen), tách chữ ghép fi, fl
- Ghép chữ bị giãn cách kiểu C H Ư Ơ N G thành CHƯƠNG (tùy chọn)
- Xem trước có đánh dấu từng chỗ đã nối, sao chép một lần bấm hoặc tải file .txt UTF-8 mở được ngay trong Word và Notepad
Vì sao copy từ PDF sang Word lại bị xuống dòng
PDF không lưu văn bản theo đoạn như Word. Nó lưu từng dòng chữ ở một vị trí cố định trên trang, nên khi bạn bôi đen và copy, trình đọc PDF chỉ biết nối các dòng bằng ký tự xuống dòng. Dán vào Word, mỗi dòng thành một đoạn, căn lề hai bên bị vỡ, thêm chữ là cả trang xô lệch. Sửa tay bằng cách xóa từng dấu xuống dòng mất rất nhiều thời gian với tài liệu vài chục trang, còn lệnh Find and Replace thay ^p bằng khoảng trắng thì xóa luôn cả chỗ hết đoạn thật, biến tài liệu thành một khối chữ liền. Công cụ này xét từng chỗ xuống dòng: dòng trước kết thúc bằng dấu chấm và ngắn hơn lề phải thì giữ, dòng sau bắt đầu bằng chữ thường thì nối, dòng sau là gạch đầu dòng thì giữ. Kết quả là văn bản sạch, dán vào Word chỉ còn việc định dạng.
Lợi ích khi sử dụng
- Tiết kiệm thời gian sửa tay khi trích nội dung hợp đồng, luận văn, báo cáo, văn bản pháp luật từ PDF
- Không làm mất chỗ xuống đoạn thật như cách thay ^p bằng khoảng trắng trong Word
- Văn bản không rời khỏi máy, phù hợp với tài liệu nội bộ và hồ sơ khách hàng
- Xử lý được cả tiếng Việt và tiếng Anh trong cùng một văn bản
- Nhìn thấy từng chỗ đã nối trước khi dùng, dễ phát hiện chỗ nối sai
Cách nối dòng văn bản copy từ PDF
- 1Mở file PDF, bôi đen phần cần lấy (Ctrl+A để chọn cả trang) và nhấn Ctrl+C.
- 2Dán vào khung Văn bản gốc. Kết quả hiện ngay ở khung bên phải, không cần bấm nút.
- 3Xem các chỗ được đánh dấu màu vàng (nối bằng khoảng trắng) và màu cam (bỏ gạch nối). Nếu văn bản tiếng Anh có nhiều từ ghép như well-known, tắt Bỏ gạch nối cuối dòng.
- 4Nếu công cụ liệt kê dòng lặp lại là tiêu đề đầu trang nhưng thực ra đó là nội dung, bỏ đánh dấu dòng đó để giữ lại.
- 5Bấm Sao chép rồi dán vào Word, Google Docs hoặc email. Hoặc bấm Tải file .txt để lưu lại.
Công cụ quyết định nối hay giữ xuống dòng như thế nào
Với mỗi chỗ xuống dòng, công cụ nhìn vào cuối dòng trên và đầu dòng dưới. Dòng dưới là gạch đầu dòng hoặc mục đánh số (1., 2), a), I.) thì luôn giữ xuống dòng. Dòng dưới bắt đầu bằng chữ thường thì gần như chắc chắn câu còn đang dở, nên nối. Dòng trên không có dấu kết câu (. ! ? : ; …) thì nối, trừ khi dòng đó ngắn hẳn so với các dòng khác và dòng dưới viết hoa, vì đó thường là tiêu đề. Dòng trên kết thúc bằng dấu chấm thì công cụ so độ dài của nó với độ dài dòng điển hình của văn bản (phân vị 75 của các dòng từ 20 ký tự trở lên): dòng kết thúc sớm trước lề phải được coi là hết đoạn, dòng chạy tới sát lề phải thì câu mới vẫn thuộc cùng đoạn. Dòng dưới lùi đầu dòng từ hai khoảng trắng trở lên sau một câu hoàn chỉnh cũng được coi là đoạn mới.
Gạch nối cuối dòng: tiếng Việt và tiếng Anh khác nhau
Tiếng Việt là ngôn ngữ đơn âm tiết, trình soạn thảo hầu như không bao giờ ngắt một chữ ra hai dòng bằng gạch nối. Tiếng Anh thì ngược lại, sách và bài báo khoa học thường ngắt từ dài như inter-national ở cuối dòng. Khi dòng trên kết thúc bằng chữ cái và dấu gạch, dòng dưới bắt đầu bằng chữ thường, công cụ bỏ gạch và ghép liền hai phần thành international. Nếu dòng dưới bắt đầu bằng chữ hoa hoặc chữ số, như Hà Nội- / Hải Phòng hay COVID- / 19, gạch được giữ và hai phần nối sát nhau. Hạn chế: công cụ không có từ điển nên không phân biệt được từ ghép có gạch thật (well-known, state-of-the-art) bị ngắt đúng chỗ gạch. Với văn bản có nhiều từ loại này, tắt tùy chọn Bỏ gạch nối cuối dòng để giữ gạch và chỉ nối dòng.
Bỏ số trang, tiêu đề đầu trang và chân trang lặp lại
Copy nhiều trang PDF một lần sẽ kéo theo số trang và dòng tiêu đề lặp ở mỗi trang, chen vào giữa câu văn. Công cụ bỏ các dòng chỉ gồm số trang theo những kiểu phổ biến: 12, - 12 -, Trang 12, Trang 12/40, Page 12 of 40, tr. 12 và số La Mã chữ thường như iv. Với tiêu đề và chân trang, công cụ đếm các dòng ngắn (dưới 90 ký tự) xuất hiện từ 3 lần trở lên, kể cả những dòng chỉ khác nhau ở con số đầu hoặc cuối dòng như Báo cáo thường niên | 1, Báo cáo thường niên | 2. Dòng đánh số mục, dòng mở đầu bằng Điều, Chương, Mục, Bảng, Hình không bao giờ bị coi là tiêu đề trang. Danh sách dòng lặp tìm được hiện ngay bên dưới tùy chọn, bạn bỏ đánh dấu dòng nào muốn giữ.
Ký tự vô hình và khoảng trắng lạ trong văn bản copy từ PDF
Văn bản lấy từ PDF hay chứa những ký tự không nhìn thấy nhưng gây lỗi khi tìm kiếm, đếm chữ hay dán vào phần mềm khác: khoảng trắng không ngắt (NBSP, U+00A0), khoảng trắng hẹp, ký tự rộng bằng không (U+200B), dấu BOM, gạch mềm (soft hyphen U+00AD), và chữ ghép fi, fl được lưu thành một ký tự riêng khiến ô tìm kiếm không thấy chữ file hay flow. Công cụ đổi các khoảng trắng lạ thành khoảng trắng thường, bỏ ký tự vô hình, tách chữ ghép và chuẩn hóa tiếng Việt về dạng dựng sẵn NFC. Chuẩn hóa NFC quan trọng vì chữ Việt copy từ một số file PDF ở dạng tổ hợp (chữ và dấu tách rời), nhìn giống hệt nhưng Word và Excel coi là chữ khác, dẫn tới lỗi tìm kiếm, sắp xếp và lọc dữ liệu.
Chữ bị giãn cách kiểu C H Ư Ơ N G
Tiêu đề trong PDF thường được giãn khoảng cách chữ để trông thoáng. Khi copy, mỗi chữ cái bị tách bằng một khoảng trắng: C H Ư Ơ N G I. Bật tùy chọn Ghép chữ bị giãn cách, công cụ tìm những dòng mà ít nhất 80% cụm chỉ có một ký tự và ghép chúng lại. Nếu các từ được ngăn bằng hai khoảng trắng trở lên, ranh giới từ được giữ, nên C H Ư Ơ N G I thành CHƯƠNG I. Nếu PDF chỉ dùng một khoảng trắng cho cả chữ lẫn từ, công cụ không có cách nào biết chỗ nào là ranh giới từ và sẽ ghép liền cả dòng, ví dụ T Ổ N G K Ế T thành TỔNGKẾT, bạn cần thêm khoảng trắng bằng tay. Vì vậy tùy chọn này tắt sẵn và chỉ nên bật khi văn bản thật sự có lỗi.
Khác gì công cụ xóa khoảng trắng và lệnh thay thế trong Word
Công cụ xóa khoảng trắng (whitespace remover) trên cùng website chỉ cắt khoảng trắng thừa ở đầu, cuối dòng, gộp khoảng trắng liên tiếp và bỏ dòng trống, nó không nối dòng. Lệnh Find and Replace trong Word thay ^p (dấu đoạn) bằng khoảng trắng thì nối tất cả, kể cả chỗ hết đoạn và gạch đầu dòng. Cách làm phổ biến trong Word là thay ^p^p bằng một ký hiệu tạm, thay ^p còn lại bằng khoảng trắng, rồi đổi ký hiệu tạm về ^p. Cách này chỉ đúng khi PDF có dòng trống giữa các đoạn, điều mà phần lớn file PDF không có. Công cụ nối dòng văn bản này dùng dấu câu, chữ hoa chữ thường và độ dài dòng để đoán, nên vẫn giữ được đoạn khi không có dòng trống. Ngược lại, nếu PDF xuất văn bản kiểu mỗi dòng cách một dòng trống, công cụ tự nhận ra và chỉ coi hai dòng trống trở lên là hết đoạn.
Giới hạn cần biết
Đây là cách đoán dựa trên quy tắc, không phải đọc hiểu nội dung, nên vẫn có trường hợp sai. Đoạn văn mà dòng cuối tình cờ chạy sát lề phải sẽ bị nối với đoạn sau. Thơ, địa chỉ, bảng biểu, mã nguồn và danh sách không có ký hiệu đầu dòng nên để nguyên, vì mỗi dòng ở đó có nghĩa riêng. Văn bản copy từ PDF nhiều cột có thể bị trộn hai cột vào nhau ngay từ lúc copy, việc này nằm ngoài khả năng của công cụ, hãy copy từng cột. PDF dạng ảnh scan không copy được chữ, cần chạy nhận dạng chữ (OCR) trước. Công cụ không giữ định dạng in đậm, in nghiêng hay bảng, kết quả là văn bản thuần. Luôn đọc lại phần đánh dấu trước khi dùng cho tài liệu quan trọng.
Câu hỏi thường gặp (FAQ)
Vì sao copy từ PDF sang Word bị xuống dòng giữa câu?
PDF lưu chữ theo từng dòng ở vị trí cố định trên trang chứ không lưu theo đoạn. Khi copy, mỗi dòng kết thúc bằng một dấu xuống dòng, Word coi mỗi dấu đó là hết đoạn nên câu bị cắt ngang.
Công cụ có giữ chỗ xuống đoạn thật không?
Có. Chỗ xuống dòng sau một câu hoàn chỉnh kết thúc sớm trước lề phải, trước gạch đầu dòng hay mục đánh số, và dòng trống đều được giữ. Chỉ những chỗ ngắt giữa câu mới bị nối.
Tôi có phải bấm nút xử lý không?
Không. Kết quả cập nhật ngay khi bạn dán văn bản hoặc đổi tùy chọn. Với văn bản rất dài, công cụ chờ bạn ngừng gõ khoảng một phần ba giây rồi mới xử lý.
Màu vàng và màu cam trong kết quả nghĩa là gì?
Nền vàng trên một khoảng trắng là chỗ hai dòng được nối bằng khoảng trắng. Nền cam trên chữ đầu của phần sau là chỗ đã bỏ gạch nối cuối dòng. Nền vàng trên một chữ cái là chỗ nối sát, ví dụ giữ gạch nối trong Hà Nội-Hải Phòng.
Công cụ có bỏ được số trang không?
Có, với các dòng chỉ gồm số trang như 5, - 5 -, Trang 5, Trang 5/20, Page 5 of 20, tr. 5 và số La Mã chữ thường. Số trang nằm chung dòng với nội dung khác thì không bị xóa.
Tiêu đề đầu trang bị xóa nhầm thì làm sao?
Dòng lặp lại được liệt kê bên dưới phần tùy chọn kèm số lần xuất hiện. Bỏ đánh dấu dòng đó để giữ lại, hoặc tắt hẳn tùy chọn Bỏ tiêu đề đầu trang, chân trang lặp lại.
Văn bản tiếng Anh có từ well-known bị nối thành wellknown, sửa thế nào?
Tắt tùy chọn Bỏ gạch nối cuối dòng. Khi đó gạch nối cuối dòng được giữ nguyên và hai dòng chỉ được nối sát lại. Công cụ không có từ điển nên không tự phân biệt được gạch ngắt từ và gạch của từ ghép.
Có dùng được cho văn bản pháp luật có Điều, Khoản không?
Được. Dòng mở đầu bằng Điều, Chương, Mục, Phần kèm số được giữ làm đầu đoạn khi dòng trước đã kết thúc câu hoặc ngắn, và không bao giờ bị coi là tiêu đề trang lặp lại. Khoản đánh số 1., 2. và điểm a), b) cũng được giữ.
Văn bản của tôi có được gửi lên máy chủ không?
Không. Toàn bộ xử lý chạy bằng JavaScript trên trình duyệt của bạn, văn bản không được gửi đi đâu và không được lưu lại sau khi bạn đóng trang.
Dán văn bản vào Word thì bị mất định dạng in đậm, có sao không?
Công cụ làm việc với văn bản thuần nên kết quả không có in đậm, in nghiêng. Sau khi dán vào Word, bạn định dạng lại tiêu đề. Nếu cần giữ định dạng, hãy dùng công cụ chuyển PDF sang Word thay vì copy.
PDF scan copy ra toàn ký tự lạ thì có sửa được không?
Không. PDF scan là ảnh, chữ copy ra (nếu có) là do lớp nhận dạng chữ của file và thường sai. Bạn cần chạy OCR để lấy chữ trước, sau đó mới dùng công cụ này để nối dòng.
Chữ tiếng Việt copy từ PDF nhìn đúng nhưng không tìm kiếm được, vì sao?
Thường do chữ ở dạng tổ hợp (chữ cái và dấu tách rời) hoặc có ký tự vô hình xen giữa. Công cụ chuẩn hóa về dạng dựng sẵn NFC và bỏ ký tự vô hình, nên sau khi xử lý bạn tìm kiếm được bình thường.
Văn bản mỗi dòng cách nhau một dòng trống thì công cụ xử lý ra sao?
Nếu phần lớn các dòng đều cách nhau đúng một dòng trống, công cụ nhận ra kiểu xuất này, bỏ qua dòng trống đơn và chỉ coi từ hai dòng trống liên tiếp trở lên là hết đoạn. Dòng thông báo phía trên kết quả sẽ ghi rõ khi điều này xảy ra.
Có giới hạn độ dài văn bản không?
Không có giới hạn cứng. Văn bản vài chục nghìn dòng vẫn xử lý trong khoảng một giây trên máy tính thông thường. Phần xem có đánh dấu chỉ hiện 400 đoạn đầu để trang không bị nặng, còn nút Sao chép và Tải file luôn lấy toàn bộ kết quả.
Từ khóa liên quan
- copy từ pdf sang word bị xuống dòng
- nối dòng văn bản
- nối dòng văn bản online
- sửa lỗi xuống dòng khi copy pdf
- bỏ xuống dòng trong word
- xóa dấu xuống dòng
- gộp dòng văn bản
- remove line breaks
- remove line breaks pdf
- copy pdf bị ngắt dòng
- copy từ pdf bị lỗi dòng
- xóa số trang khi copy pdf
- bỏ gạch nối cuối dòng
- chuẩn hóa văn bản tiếng việt
- xóa khoảng trắng không ngắt
- nối đoạn văn bản bị ngắt
- sửa văn bản copy từ pdf
- làm sạch văn bản pdf
- text line break remover
- xóa ký tự vô hình