Cách tìm một từ trong file PDF: xác định đúng trang chỉ trong vài giây
Bạn đang cầm một hợp đồng thuê nhà dài 180 trang và cần tìm điều khoản có chữ «chấm dứt». Hoặc bạn đang lục một thư mục hóa đơn để tìm đúng một mã số thuế. Hoặc bạn muốn biết thầy đã định nghĩa thuật ngữ đó ở trang nào trong tập bài giảng. Lật từng trang vừa chậm vừa dễ sai — mắt mỏi là bỏ sót đúng cái từ đang cần.
Công cụ tìm chữ trong PDF của PDF7 sinh ra cho việc này: tải tệp lên, gõ từ cần tìm, và bạn thấy nó xuất hiện ở những trang nào, bao nhiêu lần, nằm ở vị trí nào trên trang.
Ba bước tìm chữ trong PDF
- Tải tệp lên. PDF, Word (DOCX), Excel (XLSX) hoặc ảnh JPG/PNG; kéo thả cũng được.
- Gõ từ hoặc cụm từ. Bật nguyên từ nếu bạn không muốn kết quả dính vào từ dài hơn, hoặc phân biệt hoa thường khi cần.
- Xem kết quả. Chế độ danh sách liệt kê từng chỗ khớp kèm số trang và câu xung quanh. Chế độ trực quan xếp ảnh thu nhỏ của các trang và vẽ khung vàng quanh mỗi kết quả; bấm một cái là phóng to đúng chỗ.
Vì sao tìm chữ trong PDF tiếng Việt hay không ra kết quả
Tiếng Việt có mật độ dấu cao nhất trong các ngôn ngữ hệ Latinh, và đó chính là chỗ các công cụ tìm kiếm đơn giản gãy.
Dấu thanh được lưu theo hai kiểu. Chữ «ế» có thể được ghi trong tệp PDF dưới dạng một ký tự duy nhất, hoặc dưới dạng «e» cộng dấu mũ cộng dấu sắc thành ba phần tách rời. Trên màn hình chúng giống hệt nhau, nhưng với phép so sánh chuỗi thì là hai thứ khác nhau. Vì vậy văn bản trong tài liệu và từ khóa bạn gõ đều được đưa về cùng một dạng chuẩn trước khi đối chiếu, nên «hợp đồng», «quyết định» hay «Nguyễn» đều tìm ra bất kể trình tạo PDF đã mã hóa thế nào.
Chữ đ và các bảng mã cũ. Tài liệu quét lại từ những năm trước có thể dùng bảng mã cũ, khiến chữ hiện đúng trên màn hình nhưng lưu bên trong lại là ký tự khác. Với những tệp như vậy, hãy tìm phần gốc của từ và dùng chế độ trực quan để kiểm chứng vị trí.
Chữ hoa và từ ghép. Tiêu đề thường viết hoa toàn bộ, ví dụ «HỢP ĐỒNG LAO ĐỘNG». Tìm bằng chữ thường vẫn ra. Ngoài ra tiếng Việt viết rời từng âm tiết, nên nếu cụm từ dài không khớp, hãy thử một âm tiết đặc trưng thay vì cả cụm.
Tìm trong PDF quét và ảnh chụp
Tài liệu in ra từ máy photocopy hay chụp bằng điện thoại thực chất là một tấm ảnh: bên trong không có chữ để bôi đen, nên tìm kiếm thông thường không ra gì cả.
Công cụ nhận ra tình huống này và chạy nhận dạng chữ theo từng bước: quét nhanh trước, nếu chưa có kết quả thì đọc lại kỹ hơn. Nhờ vậy bạn tìm được trong hợp đồng đã quét, hóa đơn chụp bằng điện thoại hay một trang sách. Nếu sẽ mở lại tài liệu đó nhiều lần, nên dùng OCR cho PDF để gắn sẵn lớp chữ vĩnh viễn.
PDF có mật khẩu
Sao kê ngân hàng và giấy tờ tải từ cổng dịch vụ công thường được mã hóa. Khi tải tệp như vậy lên, bạn không bị chuyển sang trang khác: một ô nhập mật khẩu nhỏ hiện ngay trên thẻ tệp. Nhập mật khẩu, tài liệu mở ra và việc tìm kiếm diễn ra bình thường. Mật khẩu không được lưu ở bất kỳ đâu.
Tệp của bạn được xử lý ra sao
Tệp chỉ được xử lý để phục vụ lần tìm kiếm đó. Nó không nằm lại trên máy chủ và không được gửi tới bất kỳ dịch vụ bên ngoài nào — trong quy trình không có API của bên thứ ba. Với hợp đồng, hồ sơ bệnh án hay bảng lương, khác biệt này rất đáng kể.
Nếu nội dung cần tìm nằm rải rác ở nhiều tệp, hãy ghép PDF lại rồi tìm một lần. Tệp quá nặng thì nén PDF sẽ giúp tải lên nhanh hơn.
Câu hỏi thường gặp
Tôi gõ không dấu thì có tìm được không?
Nên gõ có dấu để chính xác nhất; công cụ vẫn đối chiếu sau khi chuẩn hóa nên khác biệt về cách mã hóa dấu không làm mất kết quả.
Có tìm được cả cụm từ không?
Có. Gõ cả cụm; cụm từ vẫn được tìm thấy khi bị ngắt dòng cắt ngang.
Hỗ trợ những định dạng nào?
PDF, tài liệu Word (kể cả chữ trong ô bảng), bảng tính Excel và ảnh JPG/PNG qua OCR.
Có cần đăng ký không?
Không. Công cụ miễn phí và không cần tài khoản.
Dùng thử ngay tại tìm chữ trong PDF.