آیا تابهحال شده است که فایل PDF را باز کنید، اما نتوانید حتی یک کلمه از آن را انتخاب یا کپی کنید؟ در چنین شرایطی فکر میکنید که فایل خراب شده، روی آن محدودیت گذاشتهاند یا صفحات آن فقط تصویر هستند؟ برای پیداکردن پاسخ، ابتدا باید تفاوت PDF متنی و PDF اسکنشده را بدانید. در PDF متنی، نوشتهها بهصورت دادههای واقعی داخل فایل ذخیره شدهاند؛ اما در PDF اسکنشده، هر صفحه ممکن است فقط عکسی از یک سند کاغذی باشد. به همین دلیل، روش جستوجو، کپی، ویرایش و استخراج متن در این دو نوع فایل یکسان نیست.
ما در این مقاله به شما یاد میدهیم که تفاوت بین این دو نوع فایل را تشخیص دهید.

تفاوت PDF متنی و PDF اسکنشده در یک نگاه
PDF متنی دارای حروف و کلمات واقعی است؛ بنابراین معمولاً میتوانید متن را انتخاب کنید، آن را کپی کنید یا با ابزار جستوجو بهدنبال یک واژه بگردید. PDF اسکنشده یا PDF تصویری معمولاً از عکس صفحات کتاب، جزوه، قرارداد یا مدرک ساخته میشود و نرمافزار PDFخوان نوشتههای داخل آن را بهعنوان متن نمیشناسد. برای استخراج نوشته از این فایلها باید از فناوری OCR یا تشخیص نوری نویسه استفاده شود.
البته یک حالت سوم نیز وجود دارد: PDF اسکنشده قابل جستجو. ظاهر این فایل همچنان شبیه اسکن است، اما نرمافزار OCR یک لایه متنی نامرئی روی تصویر قرار داده است؛ در نتیجه جستوجو و انتخاب متن امکانپذیر میشود، هرچند احتمال خطای تشخیص وجود دارد.
| ویژگی | PDF متنی | PDF اسکنشده تصویری | PDF اسکنشده OCRشده |
| انتخاب متن | دارد | ندارد | معمولاً دارد |
| جستوجوی کلمه | دارد | ندارد | دارد، اما ممکن است خطا داشته باشد |
| کپی متن | مستقیم | نیازمند OCR | احتمال خطا دارد |
| ویرایش محتوا | آسانتر | دشوار | وابسته به خروجی OCR |
| بزرگنمایی | معمولاً واضح | وابسته به رزولوشن | تصویر اصلی حفظ میشود |
| استخراج متن | مستقیم | با OCR | از لایه تشخیصدادهشده |
| دقت متن فارسی | معمولاً بالا | متن قابل استخراج ندارد | وابسته به کیفیت OCR |
| حجم فایل | اغلب کمتر | اغلب بیشتر | وابسته به تصویر و لایه متن |
حجم فایل یک معیار قطعی نیست؛ PDF متنی دارای تصاویر زیاد نیز ممکن است از یک فایل اسکنشده کمحجمتر نباشد.
PDF متنی چیست؟
PDF متنی یا Native PDF معمولاً با ذخیره یا خروجی گرفتن مستقیم از Word، Excel، PowerPoint، نرمافزارهای صفحهآرایی یا سامانههای دیجیتال ساخته میشود. در این فایل، حروف، کلمات و خطوط بخشی از ساختار سند هستند. به همین دلیل، متن اغلب بدون ابزار اضافی قابل انتخاب، کپی، جستوجو و استخراج است.
در این حالت، در بزرگنمایی زیاد نیز لبه حروف PDF بومی معمولاً واضح باقی میماند؛ زیرا متن بهصورت دیجیتال رندر میشود. برای استخراج اطلاعات از چنین فایلی نیازی به OCR نیست. مایکروسافت نیز فایلهای PDF دارای متن تعبیهشده را برای پردازش مناسبتر میداند، زیرا برخلاف OCR، خطای تشخیص حروف و محل کلمات در آنها ایجاد نمیشود.
PDF اسکنشده چیست؟
PDF اسکنشده معمولاً از عکسگرفتن یا اسکن کتاب، جزوه، فاکتور، قرارداد، مدرک هویتی یا عکس صفحات کاغذی ساخته میشود. در نوع image-only، هر صفحه برای نرمافزار یک تصویر است؛ حتی اگر انسان نوشتههای آن را کاملاً واضح ببیند. بنابراین متن مستقیماً انتخاب یا کپی نمیشود، جستوجوی واژهها نتیجهای ندارد و ویرایش نوشته اصلی نیز دشوار است.
برای تبدیل این تصویرها به داده متنی باید OCR اجرا شود. OCR حروف را از داخل عکس تشخیص داده و آنها را تبدیل به متن میکند. پس از تشخیص حروف میتوان متن را جستوجو، کپی یا در قالب قابل ویرایش استخراج کرد.

آیا هر PDF اسکنشده غیرقابل جستجو است؟
خیر. بعضی اسکنرها و نرمافزارها هنگام ساخت فایل، فناوری OCR را نیز اجرا میکنند. در این حالت ظاهر صفحه همچنان شبیه عکس یا فتوکپی باقی میماند، اما یک لایه متنی قابل جستوجو روی تصویر ایجاد میشود. به این نوع فایل، PDF اسکنشده قابل جستجو یا Searchable PDF میگویند. به کمک این لایه میتوان واژهها را جستوجو و معمولاً متن را انتخاب یا کپی کرد. همانطور که ذکر شد، Adobe و Microsoft نیز توضیح میدهند که OCR، متن تشخیصدادهشده را روی تصویر سند قرار میدهد و فایل اسکنشده را قابل جستوجو میکند.
بااینحال، انتخابشدن متن لزوماً به معنی PDF متنی بومی و کاملاً دقیق نیست. لایه OCR ممکن است در تشخیص حروف مشابه، اعداد، نامها و واژههای فارسی اشتباه کند. نتیجه OCR باید بازبینی و موارد مشکوک بهصورت دستی اصلاح شوند.
چرا دانستن نوع PDF مهم است؟
شناخت تفاوت PDF متنی و PDF اسکنشده فقط یک موضوع فنی نیست. نوع فایل مشخص میکند برای جستوجو، ویرایش یا استخراج اطلاعات باید از چه ابزاری استفاده کنید. برای مثال، هنگام تبدیل PDF به Word، یک PDF متنی معمولاً مستقیماً پردازش میشود؛ اما فایل اسکنشده ابتدا به OCR نیاز دارد.
این تفاوت هنگام استخراج متن از مقاله یا کتاب، جستجو در قراردادها و پروندهها، ترجمه PDF یا خلاصهسازی آن نیز اهمیت دارد. ابزارهای ترجمه و هوش مصنوعی زمانی عملکرد بهتری دارند که نوشتههای فایل بهصورت متن قابل استخراج در دسترس باشند.
در کاهش حجم و آرشیو اسناد نیز شناخت فایل مفید است. حجم PDF اسکنشده معمولاً بیشتر به کیفیت و رزولوشن تصاویر وابسته است، درحالیکه در PDF متنی عواملی مانند فونتها، تصاویر و ساختار سند اهمیت دارند. همچنین اگر قرار است صدها قرارداد یا پرونده بایگانی شوند، پی دی افهای اسکنشده احتمالا حجم بالایی را اشغال میکنند.
انتخاب ابزار نامناسب ممکن است زمان را تلف کند یا دقت خروجی را کاهش دهد. استفاده از OCR برای PDF متنی معمولاً ضرورتی ندارد و ممکن است نوشتههای درست را دوباره تشخیص دهد و خطا ایجاد کند.
چگونه بفهمیم PDF متنی است یا اسکنشده؟
برای تشخیص PDF اسکنشده و بررسی تفاوت PDF متنی و PDF اسکنشده، این پنج آزمایش را انجام دهید:
۱. متن را انتخاب کنید
انگشت یا ماوس را روی یک کلمه بکشید. اگر کلمات جداگانه انتخاب شدند، فایل دارای لایه متن است و میتواند PDF متنی یا OCR شده باشد. اگر کل صفحه مانند یک عکس رفتار کرد، احتمالاً با PDF تصویری روبهرو هستید. البته انتخابنشدن متن ممکن است به محدودیت امنیتی فایل نیز مربوط باشد؛ بنابراین این آزمایش بهتنهایی قطعی نیست.
۲. با Ctrl+F جستوجو کنید
یک واژه واضح و نسبتاً بلند را جستوجو کنید. پیداشدن آن نشان میدهد فایل لایه متنی دارد. نبودن نتیجه، احتمال PDF اسکنشده image-only را افزایش میدهد. اگر بعضی واژهها پیدا شوند و بعضی دیگر نه، ممکن است OCR ناقص یا کمدقت باشد. برای جستوجو کافی است زمانی که داخل فایل پی دی اف هستید، Ctrl+F را بزنید و عبارت مورد نظر خود را در باکس سرچ کنید. برای جستوجو، بهتر است واژهای را انتخاب کنید که حروف «ی» و «ک» نداشته باشد؛ زیرا شکل فارسی و عربی این حروف از نظر کد رایانهای متفاوت است. ممکن است حرف موجود در فایل با حرفی که تایپ کردهاید یکسان نباشد و در نتیجه، واژه پیدا نشود.
۳. متن را در Notepad الصاق کنید
چند خط را کپی و در یک ویرایشگر ساده مانند Notepad قرار دهید. خروجی صحیح نشانه PDF متنی بومی است. حروف جدا، جابهجاشدن کلمات یا نامفهومشدن متن میتواند از مشکل فونت، نگاشت نویسهها یا OCR ضعیف باشد. همچنین ممکن است سازنده محدودیتهایی را بر فایل اعمال کرده باشد. بهعبارت دیگر، هر فایلی که درست کپی نمیشود، لزوماً اسکنشده نیست، اما به هر حال نمیتوان از آن استفاده کرد.
۴. صفحه را بزرگنمایی کنید
در زوم ۴۰۰ تا ۸۰۰ درصد، پیکسلی و دندانهدارشدن همه نوشتهها میتواند نشانه تصویری بودن صفحه باشد. واضحماندن حروف معمولاً به متن دیجیتال یا محتوای برداری اشاره دارد؛ اما این روش قطعی نیست، زیرا اسکن باکیفیت نیز ممکن است واضح دیده شود.

۵. استخراج متن را آزمایش کنید
فایل را در یک ابزار استخراج متن، باز کنید. اگر نوشتهها مستقیماً استخراج نشدند و ابزار اجرای OCR را پیشنهاد کرد، فایل احتمالاً تصویری است. برای بررسی گزینههای مناسب میتوانید راهنمای ابزارهای تبدیل PDF به متن را بخوانید.
تصمیم سریع: متن انتخاب میشود؟ فایل احتمالاً متنی یا OCRشده است. انتخاب نمیشود؟ جستوجوی Ctrl+F و محدودیتهای فایل را بررسی کنید. همچنان متنی پیدا نمیشود؟ فایل را با OCR پردازش کنید.
برای هر نوع PDF چه کاری انجام دهیم؟
PDF متنی
در PDF متنی ابتدا نوشته را مستقیماً انتخاب، کپی، جستجو یا استخراج کنید. برای انتقال محتوا به Word یا ابزار خلاصهسازی معمولاً نیازی به اجرای OCR نیست. فقط اگر متن بههمریخته کپی میشود، مشکل فونت، کدگذاری یا محدودیتهای امنیتی فایل را بررسی کنید.
PDF اسکنشده تصویری
اگر صفحهها فقط تصویر هستند، از سرویس تبدیل PDF به متن پیدیمو یا ابزار OCR دیگری استفاده کنید. OCR نوشتههای داخل تصویر را شناسایی میکند و میتواند آنها را به متن قابل جستجو یا قابل ویرایش تبدیل کند.
PDF اسکنشده قابل جستجو
در این فایلها ابتدا چند بخش حساس مانند نام افراد، اعداد، تاریخها، مبالغ، جدولها و عبارتهای فارسی را آزمایش کنید. وجود امکان انتخاب متن به معنی دقیقبودن کامل لایه OCR نیست. اگر خطا زیاد بود، OCR را با انتخاب زبان فارسی و کیفیت مناسب دوباره اجرا کنید. میتوانید برای این کار از پیدیمو استفاده کنید. نسخه اصلی فایل را نگه دارید و خروجی را بازبینی کنید.
سؤالات متداول درباره PDF متنی و PDF اسکنشده
چرا متن داخل PDF انتخاب نمیشود؟
فایل ممکن است اسکنشده و تصویری باشد، متن آن هنگام ساخت به تصویر تبدیل شده باشد یا محدودیت کپی و ویرایش داشته باشد. مشکلات فونت و کدگذاری نیز گاهی باعث میشوند متن انتخاب شود، اما درست کپی نشود.
آیا هر فایل اسکنشده به OCR نیاز دارد؟
خیر. فقط فایلهای اسکنشدهای که هیچ لایه متنی ندارند، برای جستوجو و استخراج نوشته به OCR نیاز دارند. بعضی PDFهای اسکنشده قبلاً OCR شدهاند و متن آنها قابل انتخاب و جستوجو است.
آیا OCR متن را بدون خطا استخراج میکند؟
خیر. دقت OCR به کیفیت اسکن، وضوح نوشته، زبان، فونت، زاویه صفحه و وجود جدول یا متن چندستونه بستگی دارد. اعداد، نامها و کلمات فارسی باید پس از استخراج بازبینی شوند. یکی از تفاوت هایPDF متنی و PDF اسکنشده نیز همین است.
آیا میتوان PDF اسکنشده را به PDF متنی تبدیل کرد؟
بله. OCR میتواند برای فایل اسکنشده یک لایه متن قابل جستوجو ایجاد کند. همچنین میتوان نوشتهها را در قالبهایی مانند Word یا TXT استخراج کرد. البته خروجی OCR ممکن است به اصلاح نیاز داشته باشد.
از کجا بفهمیم مشکل PDF از قفل بودن است؟
اگر متن دیده میشود اما امکان کپی، چاپ یا ویرایش آن وجود ندارد، تنظیمات امنیتی فایل را بررسی کنید. در Adobe Acrobat میتوانید از مسیر Document Properties > Security محدودیتهای فایل را ببینید. تغییر این محدودیتها معمولاً به رمز مالک فایل نیاز دارد.
