جستوجوی یک کلمه در فایل PDF: رسیدن به صفحهٔ درست در چند ثانیه
یک قرارداد اجارهٔ ۱۸۰ صفحهای پیش رویتان است و باید بندی را پیدا کنید که واژهٔ «فسخ» در آن آمده. یا میان پوشهای پر از فاکتور دنبال یک شمارهٔ اقتصادی مشخص میگردید. یا میخواهید بدانید استاد در کدام صفحهٔ جزوه آن اصطلاح را تعریف کرده است. ورق زدن صفحهبهصفحه هم کند است و هم مطمئن نیست؛ چشم که خسته شود، دقیقاً همان کلمهای را جا میاندازد که دنبالش بودید.
ابزار جستوجوی متن در PDF از PDF7 برای همین ساخته شده است: فایل را بارگذاری کنید، کلمه را بنویسید و ببینید در کدام صفحهها، چند بار و در چه نقطهای از صفحه آمده است.
در سه گام داخل PDF جستوجو کنید
- فایل را بارگذاری کنید. PDF، ورد (DOCX)، اکسل (XLSX) یا تصویر JPG/PNG؛ کشیدن و رها کردن هم کار میکند.
- کلمه یا عبارت را بنویسید. در صورت نیاز گزینهٔ کلمهٔ کامل یا حساس به بزرگی و کوچکی حروف را روشن کنید.
- نتیجهها را ببینید. در نمای فهرست هر یافته با شمارهٔ صفحه و جملهٔ پیرامونش نشان داده میشود. در نمای تصویری، تصویر کوچک صفحهها کنار هم میآید و دور هر یافته کادر زرد کشیده میشود؛ با یک کلیک روی همان نقطه بزرگنمایی میکنید.
چرا جستوجو در PDFهای فارسی معمولاً نتیجه نمیدهد
خط فارسی چند دام فنی دارد که جستوجوهای ساده را از کار میاندازد.
«ک» و «ی» عربی در برابر فارسی. بسیاری از فایلها با صفحهکلید یا قلم عربی تولید شدهاند و در آنها «ک» بهصورت «ك» و «ی» بهصورت «ي» ذخیره شده است. روی صفحه تفاوتی دیده نمیشود، اما برای مقایسهٔ رایانهای دو نویسهٔ متفاوتاند؛ به همین دلیل جستوجوی «کارگر» در سندی که «كارگر» نوشته شده هیچ نتیجهای نمیدهد. این ابزار این گونهها را همارز میشمارد، بنابراین با هر کدام که بنویسید هر دو نوشتار پیدا میشوند.
شکلگیری حروف. حرف فارسی بسته به جایگاهش در کلمه شکل عوض میکند و برخی تولیدکنندههای PDF بهجای حرف اصلی، همان «شکل نمایشی» را ذخیره میکنند؛ بعضی نیز ترتیب حروف را وارونه مینویسند. متن پیش از مقایسه به حروف پایه بازگردانده میشود، پس در این فایلهای بهاصطلاح خراب هم جستوجو کار میکند.
نیمفاصله و اعراب. «میروم» و «میروم»، یا «کتابها» و «کتابها»، در بسیاری از اسناد به هر دو شکل نوشته میشوند. اگر جستوجوی نخست نتیجه نداد، صورت دیگر را امتحان کنید یا فقط ریشهٔ کلمه را بنویسید. نشانههای اعراب و کشیدگی «ـ» هم در مقایسه نادیده گرفته میشوند.
جستوجو در PDFهای اسکنشده و در تصاویر
سندی که از دستگاه کپی بیرون آمده یا با گوشی عکس گرفته شده، در واقع یک تصویر است: متن قابل انتخاب ندارد و جستوجوی معمولی در آن هیچ چیزی پیدا نمیکند.
ابزار این وضعیت را تشخیص میدهد و بازشناسی نوری حروف را مرحلهبهمرحله اجرا میکند: نخست یک گذر سریع و اگر چیزی به دست نیامد، گذری دقیقتر. به این ترتیب میتوانید در قرارداد اسکنشده، رسید عکسگرفته یا صفحهٔ یک کتاب جستوجو کنید. اگر قرار است همان سند را بارها باز کنید، بهتر است نخست با OCR برای PDF یک لایهٔ متنی دائمی به آن بیفزایید.
PDFهای رمزدار
صورتحسابهای بانکی و مدارک سامانههای دولتی اغلب رمزگذاری شدهاند. با بارگذاری چنین فایلی به صفحهٔ دیگری منتقل نمیشوید: یک کادر کوچک رمز درست روی کارت فایل باز میشود. رمز را وارد میکنید، سند باز میشود و جستوجو مثل همیشه انجام میگیرد. رمز در هیچ جایی ذخیره نمیشود.
بر سر فایل شما چه میآید
فایل فقط برای همین جستوجو پردازش میشود. روی سرور نگه داشته نمیشود و به هیچ سرویس بیرونی فرستاده نمیشود؛ در این مسیر هیچ رابط برنامهنویسی شخص ثالثی وجود ندارد. برای قرارداد، پروندهٔ پزشکی یا فیش حقوقی این تفاوت اهمیت دارد.
اگر متن مورد نظر در چند فایل پراکنده است، نخست با ادغام PDF آنها را یکی کنید و یک بار جستوجو کنید. برای فایلهای خیلی بزرگ، فشردهسازی PDF بارگذاری را سریعتر میکند.
پرسشهای پرتکرار
اگر «ک» عربی تایپ کنم باز هم پیدا میشود؟
بله. گونههای «ک/ك» و «ی/ي» همارز در نظر گرفته میشوند.
میتوانم یک عبارت کامل را جستوجو کنم؟
بله، عبارت را کامل بنویسید؛ حتی اگر شکستن سطر آن را دو تکه کرده باشد پیدا میشود.
چه قالبهایی پشتیبانی میشوند؟
PDF، سندهای ورد (شامل متن داخل خانههای جدول)، صفحهگستردههای اکسل و تصاویر JPG و PNG از راه OCR.
به حساب کاربری نیاز است؟
خیر. ابزار رایگان است و نیازی به ثبتنام ندارد.
همین حالا امتحان کنید: جستوجوی متن در PDF.