تفاوت PDF متنی و PDF اسکن‌شده چیست؟ ۵ روش ساده برای تشخیص

آیا تابه‌حال شده است که فایل PDF را باز کنید، اما نتوانید حتی یک کلمه از آن را انتخاب یا کپی کنید؟ در چنین شرایطی فکر می‌کنید که فایل خراب شده، روی آن محدودیت گذاشته‌اند یا صفحات آن فقط تصویر هستند؟ برای پیداکردن پاسخ، ابتدا باید تفاوت PDF متنی و PDF اسکن‌شده را بدانید. در PDF متنی، نوشته‌ها به‌صورت داده‌های واقعی داخل فایل ذخیره شده‌اند؛ اما در PDF اسکن‌شده، هر صفحه ممکن است فقط عکسی از یک سند کاغذی باشد. به همین دلیل، روش جست‌وجو، کپی، ویرایش و استخراج متن در این دو نوع فایل یکسان نیست.

ما در این مقاله به شما یاد می‌دهیم که تفاوت بین این دو نوع فایل را تشخیص دهید. 

تفاوت PDF متنی و PDF اسکن‌شده

تفاوت PDF متنی و PDF اسکن‌شده در یک نگاه

PDF متنی دارای حروف و کلمات واقعی است؛ بنابراین معمولاً می‌توانید متن را انتخاب کنید، آن را کپی کنید یا با ابزار جست‌وجو به‌دنبال یک واژه بگردید. PDF اسکن‌شده یا PDF تصویری معمولاً از عکس صفحات کتاب، جزوه، قرارداد یا مدرک ساخته می‌شود و نرم‌افزار PDF‌خوان نوشته‌های داخل آن را به‌عنوان متن نمی‌شناسد. برای استخراج نوشته از این فایل‌ها باید از فناوری OCR یا تشخیص نوری نویسه استفاده شود.

البته یک حالت سوم نیز وجود دارد: PDF اسکن‌شده قابل جستجو. ظاهر این فایل همچنان شبیه اسکن است، اما نرم‌افزار OCR یک لایه متنی نامرئی روی تصویر قرار داده است؛ در نتیجه جست‌وجو و انتخاب متن امکان‌پذیر می‌شود، هرچند احتمال خطای تشخیص وجود دارد. 

ویژگیPDF متنیPDF اسکن‌شده تصویریPDF اسکن‌شده OCRشده
انتخاب متنداردنداردمعمولاً دارد
جست‌وجوی کلمهداردندارددارد، اما ممکن است خطا داشته باشد
کپی متنمستقیمنیازمند OCRاحتمال خطا دارد
ویرایش محتواآسان‌تردشواروابسته به خروجی OCR
بزرگ‌نماییمعمولاً واضحوابسته به رزولوشنتصویر اصلی حفظ می‌شود
استخراج متنمستقیمبا OCRاز لایه تشخیص‌داده‌شده
دقت متن فارسیمعمولاً بالامتن قابل استخراج نداردوابسته به کیفیت OCR
حجم فایلاغلب کمتراغلب بیشتروابسته به تصویر و لایه متن

حجم فایل یک معیار قطعی نیست؛ PDF متنی دارای تصاویر زیاد نیز ممکن است از یک فایل اسکن‌شده کم‌حجم‌تر نباشد.

PDF متنی چیست؟

PDF متنی یا Native PDF معمولاً با ذخیره یا خروجی گرفتن مستقیم از Word، Excel، PowerPoint، نرم‌افزارهای صفحه‌آرایی یا سامانه‌های دیجیتال ساخته می‌شود. در این فایل، حروف، کلمات و خطوط بخشی از ساختار سند هستند. به همین دلیل، متن اغلب بدون ابزار اضافی قابل انتخاب، کپی، جست‌وجو و استخراج است.

در این حالت، در بزرگ‌نمایی زیاد نیز لبه حروف PDF بومی معمولاً واضح باقی می‌ماند؛ زیرا متن به‌صورت دیجیتال رندر می‌شود. برای استخراج اطلاعات از چنین فایلی نیازی به OCR نیست. مایکروسافت نیز فایل‌های PDF دارای متن تعبیه‌شده را برای پردازش مناسب‌تر می‌داند، زیرا برخلاف OCR، خطای تشخیص حروف و محل کلمات در آن‌ها ایجاد نمی‌شود.

PDF اسکن‌شده چیست؟

PDF اسکن‌شده معمولاً از عکس‌گرفتن یا اسکن کتاب، جزوه، فاکتور، قرارداد، مدرک هویتی یا عکس صفحات کاغذی ساخته می‌شود. در نوع image-only، هر صفحه برای نرم‌افزار یک تصویر است؛ حتی اگر انسان نوشته‌های آن را کاملاً واضح ببیند. بنابراین متن مستقیماً انتخاب یا کپی نمی‌شود، جست‌وجوی واژه‌ها نتیجه‌ای ندارد و ویرایش نوشته اصلی نیز دشوار است.

برای تبدیل این تصویرها به داده متنی باید OCR اجرا شود. OCR حروف را از داخل عکس تشخیص داده و آنها را تبدیل به متن می‌کند.  پس از تشخیص حروف می‌توان متن را جست‌وجو، کپی یا در قالب قابل ویرایش استخراج کرد. 

تفاوت PDF متنی و PDF اسکن‌شده

آیا هر PDF اسکن‌شده غیرقابل جستجو است؟

خیر. بعضی اسکنرها و نرم‌افزارها هنگام ساخت فایل، فناوری OCR را نیز اجرا می‌کنند. در این حالت ظاهر صفحه همچنان شبیه عکس یا فتوکپی باقی می‌ماند، اما یک لایه متنی قابل جست‌وجو روی تصویر ایجاد می‌شود. به این نوع فایل، PDF اسکن‌شده قابل جستجو یا Searchable PDF می‌گویند. به کمک این لایه می‌توان واژه‌ها را جست‌وجو و معمولاً متن را انتخاب یا کپی کرد. همان‌طور که ذکر شد، Adobe و Microsoft نیز توضیح می‌دهند که OCR، متن تشخیص‌داده‌شده را روی تصویر سند قرار می‌دهد و فایل اسکن‌شده را قابل جست‌وجو می‌کند.

بااین‌حال، انتخاب‌شدن متن لزوماً به معنی PDF متنی بومی و کاملاً دقیق نیست. لایه OCR ممکن است در تشخیص حروف مشابه، اعداد، نام‌ها و واژه‌های فارسی اشتباه کند. نتیجه OCR باید بازبینی و موارد مشکوک به‌صورت دستی اصلاح شوند.

چرا دانستن نوع PDF مهم است؟

شناخت تفاوت PDF متنی و PDF اسکن‌شده فقط یک موضوع فنی نیست. نوع فایل مشخص می‌کند برای جست‌وجو، ویرایش یا استخراج اطلاعات باید از چه ابزاری استفاده کنید. برای مثال، هنگام تبدیل PDF به Word، یک PDF متنی معمولاً مستقیماً پردازش می‌شود؛ اما فایل اسکن‌شده‌ ابتدا به OCR نیاز دارد. 

این تفاوت هنگام استخراج متن از مقاله یا کتاب، جستجو در قراردادها و پرونده‌ها، ترجمه PDF یا خلاصه‌سازی آن نیز اهمیت دارد. ابزارهای ترجمه و هوش مصنوعی زمانی عملکرد بهتری دارند که نوشته‌های فایل به‌صورت متن قابل استخراج در دسترس باشند. 

در کاهش حجم و آرشیو اسناد نیز شناخت فایل مفید است. حجم PDF اسکن‌شده معمولاً بیشتر به کیفیت و رزولوشن تصاویر وابسته است، درحالی‌که در PDF متنی عواملی مانند فونت‌ها، تصاویر و ساختار سند اهمیت دارند. همچنین اگر قرار است صدها قرارداد یا پرونده بایگانی شوند، پی دی اف‌های اسکن‌شده احتمالا حجم بالایی را اشغال می‌کنند. 

انتخاب ابزار نامناسب ممکن است زمان را تلف کند یا دقت خروجی را کاهش دهد. استفاده از OCR برای PDF متنی معمولاً ضرورتی ندارد و ممکن است نوشته‌های درست را دوباره تشخیص دهد و خطا ایجاد کند. 

چگونه بفهمیم PDF متنی است یا اسکن‌شده؟

برای تشخیص PDF اسکن‌شده و بررسی تفاوت PDF متنی و PDF اسکن‌شده، این پنج آزمایش را انجام دهید:

۱. متن را انتخاب کنید

انگشت یا ماوس را روی یک کلمه بکشید. اگر کلمات جداگانه انتخاب شدند، فایل دارای لایه متن است و می‌تواند PDF متنی یا OCR شده باشد. اگر کل صفحه مانند یک عکس رفتار کرد، احتمالاً با PDF تصویری روبه‌رو هستید. البته انتخاب‌نشدن متن ممکن است به محدودیت امنیتی فایل نیز مربوط باشد؛ بنابراین این آزمایش به‌تنهایی قطعی نیست.

۲. با Ctrl+F جست‌وجو کنید

یک واژه واضح و نسبتاً بلند را جست‌وجو کنید. پیداشدن آن نشان می‌دهد فایل لایه متنی دارد. نبودن نتیجه، احتمال PDF اسکن‌شده image-only را افزایش می‌دهد. اگر بعضی واژه‌ها پیدا شوند و بعضی دیگر نه، ممکن است OCR ناقص یا کم‌دقت باشد. برای جست‌وجو کافی است زمانی که داخل فایل پی دی اف هستید، Ctrl+F را بزنید و عبارت مورد نظر خود را در باکس سرچ کنید. برای جست‌وجو، بهتر است واژه‌ای را انتخاب کنید که حروف «ی» و «ک» نداشته باشد؛ زیرا شکل فارسی و عربی این حروف از نظر کد رایانه‌ای متفاوت است. ممکن است حرف موجود در فایل با حرفی که تایپ کرده‌اید یکسان نباشد و در نتیجه، واژه پیدا نشود.

۳. متن را در Notepad الصاق کنید

چند خط را کپی و در یک ویرایشگر ساده مانند Notepad قرار دهید. خروجی صحیح نشانه PDF متنی بومی است. حروف جدا، جابه‌جاشدن کلمات یا نامفهوم‌شدن متن می‌تواند از مشکل فونت، نگاشت نویسه‌ها یا OCR ضعیف باشد. همچنین ممکن است سازنده محدودیت‌هایی را بر فایل اعمال کرده باشد. به‌عبارت دیگر، هر فایلی که درست کپی نمی‌شود، لزوماً اسکن‌شده نیست، اما به هر حال نمی‌توان از آن استفاده کرد. 

۴. صفحه را بزرگ‌نمایی کنید

در زوم ۴۰۰ تا ۸۰۰ درصد، پیکسلی و دندانه‌دارشدن همه نوشته‌ها می‌تواند نشانه تصویری بودن صفحه باشد. واضح‌ماندن حروف معمولاً به متن دیجیتال یا محتوای برداری اشاره دارد؛ اما این روش قطعی نیست، زیرا اسکن باکیفیت نیز ممکن است واضح دیده شود.

تفاوت PDF متنی و PDF اسکن‌شده

۵. استخراج متن را آزمایش کنید

فایل را در یک ابزار استخراج متن، باز کنید. اگر نوشته‌ها مستقیماً استخراج نشدند و ابزار اجرای OCR را پیشنهاد کرد، فایل احتمالاً تصویری است. برای بررسی گزینه‌های مناسب می‌توانید راهنمای ابزارهای تبدیل PDF به متن را بخوانید.

تصمیم سریع: متن انتخاب می‌شود؟ فایل احتمالاً متنی یا OCRشده است. انتخاب نمی‌شود؟ جست‌وجوی Ctrl+F و محدودیت‌های فایل را بررسی کنید. همچنان متنی پیدا نمی‌شود؟ فایل را با OCR پردازش کنید.

برای هر نوع PDF چه کاری انجام دهیم؟

PDF متنی

در PDF متنی ابتدا نوشته را مستقیماً انتخاب، کپی، جستجو یا استخراج کنید. برای انتقال محتوا به Word یا ابزار خلاصه‌سازی معمولاً نیازی به اجرای OCR نیست. فقط اگر متن به‌هم‌ریخته کپی می‌شود، مشکل فونت، کدگذاری یا محدودیت‌های امنیتی فایل را بررسی کنید.

PDF اسکن‌شده تصویری

اگر صفحه‌ها فقط تصویر هستند، از سرویس تبدیل PDF به متن پیدیمو یا ابزار OCR دیگری استفاده کنید.  OCR نوشته‌های داخل تصویر را شناسایی می‌کند و می‌تواند آن‌ها را به متن قابل جستجو یا قابل ویرایش تبدیل کند.

 PDF اسکن‌شده قابل جستجو

در این فایل‌ها ابتدا چند بخش حساس مانند نام افراد، اعداد، تاریخ‌ها، مبالغ، جدول‌ها و عبارت‌های فارسی را آزمایش کنید. وجود امکان انتخاب متن به معنی دقیق‌بودن کامل لایه OCR نیست. اگر خطا زیاد بود، OCR را با انتخاب زبان فارسی و کیفیت مناسب دوباره اجرا کنید. می‌توانید برای این کار از پیدیمو استفاده کنید. نسخه اصلی فایل را نگه دارید و خروجی را بازبینی کنید.

سؤالات متداول درباره PDF متنی و PDF اسکن‌شده

چرا متن داخل PDF انتخاب نمی‌شود؟

فایل ممکن است اسکن‌شده و تصویری باشد، متن آن هنگام ساخت به تصویر تبدیل شده باشد یا محدودیت کپی و ویرایش داشته باشد. مشکلات فونت و کدگذاری نیز گاهی باعث می‌شوند متن انتخاب شود، اما درست کپی نشود.

آیا هر فایل اسکن‌شده به OCR نیاز دارد؟

خیر. فقط فایل‌های اسکن‌شده‌ای که هیچ لایه متنی ندارند، برای جست‌وجو و استخراج نوشته به OCR نیاز دارند. بعضی PDFهای اسکن‌شده قبلاً OCR شده‌اند و متن آن‌ها قابل انتخاب و جست‌وجو است.

آیا OCR متن را بدون خطا استخراج می‌کند؟

خیر. دقت OCR به کیفیت اسکن، وضوح نوشته، زبان، فونت، زاویه صفحه و وجود جدول یا متن چندستونه بستگی دارد. اعداد، نام‌ها و کلمات فارسی باید پس از استخراج بازبینی شوند. یکی از تفاوت‌ هایPDF  متنی و PDF اسکن‌شده نیز همین است.

آیا می‌توان PDF اسکن‌شده را به PDF متنی تبدیل کرد؟

بله. OCR می‌تواند برای فایل اسکن‌شده یک لایه متن قابل جست‌وجو ایجاد کند. همچنین می‌توان نوشته‌ها را در قالب‌هایی مانند Word یا TXT استخراج کرد. البته خروجی OCR ممکن است به اصلاح نیاز داشته باشد.

از کجا بفهمیم مشکل PDF از قفل بودن است؟

اگر متن دیده می‌شود اما امکان کپی، چاپ یا ویرایش آن وجود ندارد، تنظیمات امنیتی فایل را بررسی کنید. در Adobe Acrobat می‌توانید از مسیر Document Properties > Security محدودیت‌های فایل را ببینید. تغییر این محدودیت‌ها معمولاً به رمز مالک فایل نیاز دارد.

دیدگاه‌ خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

اسکرول به بالا