Счётчик символов и слов в PDF
Как посчитать слова в PDF
- Перетащите PDF (или файл Word, ODT, текстовый) в область выше или нажмите, чтобы выбрать.
- Переключите режим на слова.
- Нажмите кнопку подсчёта — количество слов появится мгновенно. В любой момент можно вернуться к символам: обе метрики считаются сразу.
Вопросы и ответы
Мои файлы загружаются на сервер?
Нет. Вся обработка выполняется прямо в вашем браузере. Файлы никогда не отправляются на сервер — у нас нет бэкенда для их получения.
Как считаются символы (знаки)?
Считаются все символы (знаки), кроме переносов строк. Пробелы, знаки препинания и специальные символы включены. Это соответствует стандарту, принятому в переводческой и издательской отрасли.
Можно ли считать несколько файлов сразу?
Да. Выберите или перетащите несколько файлов — инструмент обработает каждый и покажет результаты в таблице. Результаты можно экспортировать в CSV.
Почему символы, а не слова?
В переводе и издательском деле расчёт стоимости часто основан на количестве символов, а не слов — особенно для таких языков как русский, японский или китайский, где границы слов различаются. Подсчёт символов даёт более стабильный и нейтральный показатель.
Какие форматы поддерживаются?
.pdf — любой PDF с выделяемым текстом; .docx, .docm — Microsoft Word (Office 2007+); .doc — Microsoft Word (Office 97–2003), частичная поддержка.
Почему .doc показывает 0 символов?
Старые файлы .doc (Office 97–2003) поддерживаются частично. Если файл защищён паролем или использует редкую кодировку, извлечение может завершиться без ошибки, но с пустым результатом. Попробуйте пересохранить файл в формате .docx в Microsoft Word.
Почему количество слов в PDF отличается от Word?
Правило одно для всех форматов: тело документа плюс колонтитулы, сноски, концевые сноски и текст надписей. Microsoft Word не учитывает колонтитулы в собственном подсчёте, поэтому наше число обычно больше — это сделано намеренно. Есть одно реальное отличие: колонтитул, повторяющийся на каждой странице PDF, считается по разу на странице, а в .docx он хранится — и считается нами — один раз.
Учитываете ли вы текст в колонтитулах?
Да, и это осознанное решение. Для .doc, .docx, .odt и .pdf мы считаем тело документа плюс колонтитулы, сноски, концевые сноски и текст надписей. Microsoft Word не включает колонтитулы в собственный подсчёт слов, поэтому наше число обычно больше. Переводчику платят и за этот текст, поэтому мы его считаем.
Можно ли посчитать слова в отсканированном PDF?
Пока нет. Отсканированные PDF — это изображения, в них нет выделяемого текста. Сначала примените OCR (оптическое распознавание символов), чтобы преобразовать скан в текст. Подойдут Adobe Acrobat или бесплатные онлайн-сервисы OCR.
Есть ли ограничение на размер файла?
Нет. Поскольку обработка выполняется в браузере, ограничений на стороне сервера нет. Очень большие файлы могут обрабатываться дольше — в зависимости от ресурсов устройства.
Инструмент оказался полезным?