Как найти слово в PDF: находим нужную страницу за секунды
Перед вами договор аренды на 180 страниц, и нужен пункт, где встречается слово «расторжение». Или вы перебираете папку счетов в поисках конкретного ИНН. Или хотите понять, на какой странице конспекта преподаватель дал определение термина. Листать страницу за страницей долго и ненадёжно: глаз устаёт и пропускает именно то слово, которое вы ищете.
Инструмент поиск текста в PDF от PDF7 сделан именно для этого: загрузите файл, введите слово и увидите, на каких страницах оно встречается, сколько раз и в каком месте страницы.
Как искать в PDF за три шага
- Загрузите файл. PDF, Word (DOCX), Excel (XLSX) или изображение JPG/PNG — можно перетащить мышью.
- Введите слово или фразу. При необходимости включите только целое слово, чтобы «подпись» не считалась в «подписант», или учитывать регистр.
- Изучите результаты. В списке каждое совпадение показано с номером страницы и окружающим предложением. В визуальном режиме страницы выстраиваются миниатюрами, а найденные слова обведены жёлтой рамкой — щёлкните и увеличьте нужное место.
Почему поиск по русским PDF часто не находит ничего
С кириллицей у простых поисковых функций возникает сразу несколько сложностей.
Буквы «е» и «ё». В одном документе может встречаться «учёт», а в другом месте того же файла — «учет». Это разные символы, и буквальное сравнение строк одну из форм не найдёт. Здесь «е» и «ё» считаются равнозначными, поэтому запрос находит оба варианта написания.
Похожие латинские буквы. Многие PDF собираются из вёрстки, где часть символов случайно набрана латиницей: «А», «В», «С», «Е», «О», «Р», «Х» выглядят одинаково в обоих алфавитах, но кодируются по-разному. Из-за этого слово на экране читается нормально, а поиск его не находит. Текст приводится к единому виду, что снимает часть таких случаев.
Регистр и словоформы. «ДОГОВОР» в шапке документа находится по запросу «договор». А поскольку русский язык флективный, искомое слово в тексте обычно стоит в другом падеже: ищите корень («договор» вместо «договора») и оставьте параметр «только целое слово» выключенным. Слова, перенесённые по слогам в конце строки, тоже находятся.
Номера и цифры. Отдельная история — поиск номера договора, ИНН или счёта. В вёрстке такие последовательности часто разбиты пробелами, неразрывными пробелами или разными видами тире, поэтому набранный подряд номер не совпадает с тем, что записано в файле. Надёжнее искать фрагмент без разделителей — например, последние шесть цифр, — а затем убедиться в правильности находки в визуальном режиме.
Пять шагов, если результатов нет вовсе
Вы уверены, что слово есть в документе, но поиск возвращает пустоту. Пройдите по списку:
- Ищите более короткий корень. Введите «счёт» вместо «счёта-фактуры», чтобы захватить все падежные формы.
- Отключите «только целое слово». Пока эта настройка включена, считаются лишь отдельно стоящие вхождения.
- Проверьте, выделяется ли текст. Если курсором не удаётся выделить строку, страница — скан, и нужно распознавание.
- Переключитесь в визуальный режим. На изображении страницы видно, как термин написан на самом деле: в документах часто стоит сокращение или синоним.
- Уберите знаки препинания. В записях вроде «№ счёта» символ номера может быть набран разными знаками; надёжнее искать только слово.
Инструмент работает и как счётчик: список результатов показывает, сколько раз в отчёте встречается слово «просрочка» или сколько раз в дипломной работе процитирован источник, — без чтения всего текста.
Поиск в отсканированных PDF и на фотографиях
Документ из копировального аппарата или снятый на телефон — это картинка: выделяемого текста в нём нет, и обычный поиск не найдёт ничего.
Инструмент распознаёт такую ситуацию и запускает распознавание текста поэтапно: сначала быстрый проход, затем, если ничего не нашлось, более тщательный. Так можно искать в отсканированном договоре, сфотографированной квитанции или странице книги. Если один и тот же документ нужен часто, быстрее сначала добавить постоянный текстовый слой через OCR для PDF.
PDF с паролем
Банковские выписки и документы с государственных порталов нередко зашифрованы. При загрузке такого файла вас не перебрасывает на другую страницу: прямо на карточке файла открывается небольшое поле для пароля. Вы вводите его, документ открывается, и поиск работает как обычно. Пароль нигде не сохраняется.
Что происходит с вашими файлами
Файл обрабатывается только для поиска. Он не хранится на сервере и не передаётся во внешние сервисы — сторонних API в цепочке нет. Для договоров, медицинских документов и расчётных листков это существенная разница.
Если нужный текст разбросан по нескольким документам, сначала объедините PDF и выполните один поиск. Очень большой файл удобнее сначала сжать, чтобы он быстрее загрузился.
Частые вопросы
Найдёт ли поиск слово с «ё», если я набрал «е»?
Да, и наоборот. Эти буквы считаются равнозначными.
Можно ли искать целую фразу?
Да, введите фразу полностью — она находится и тогда, когда её разрывает перенос строки.
Какие форматы поддерживаются?
PDF, документы Word (включая текст в ячейках таблиц), таблицы Excel и изображения JPG/PNG через OCR.
Нужна ли регистрация?
Нет, инструмент бесплатный и не требует учётной записи.
Попробуйте прямо сейчас: поиск текста в PDF.