چرا متن PDF کپی نمی‌شود و چگونه آن را استخراج کنیم؟

کپی نشدن متن PDF یکی از مشکلات رایج هنگام کار با این فایل‌ها است. گاهی فایل باز می‌شود، اما وقتی می‌خواهید بخشی از متن را انتخاب یا کپی کنید، هیچ اتفاقی نمی‌افتد یا متن کپی‌شده به‌هم می‌ریزد. علت این مشکل همیشه یکسان نیست؛ ممکن است فایل اسکن‌شده باشد، امکان کپی در آن محدود شده باشد، فونت یا کدگذاری متن مشکل داشته باشد یا اصلاً نوشته‌های داخل صفحه به‌صورت تصویر ذخیره شده باشند.

مشکل از هر کجا که باشد، ما در این مقاله به شما یاد می‌دهیم که چگونه چنین متن‌هایی را استخراج کنید. اگر می‌خواهید بدانید که چرا متن PDF کپی نمی‌شود و چگونه آن را استخراج کنیم؟ این مقاله را از دست ندهید. 

کپی نشدن متن PDF

چرا متن PDF کپی نمی‌شود؟

برای حل مشکل کپی نشدن متن PDF، اول باید بفهمیم چرا متن کپی نمی‌شود؟

فایل PDF اسکن‌شده است

یکی از رایج‌ترین علت‌ها این است که فایل PDF، اسکن‌شده است. یعنی صفحه‌های یک کتاب، جزوه، قرارداد یا فاکتور اسکن شده و به PDF تبدیل شده‌اند. در این نوع فایل، نوشته‌ها در واقع بخشی از تصویر هستند، نه متن قابل ویرایش. برای استخراج متن از PDF غیرقابل کپی که به شکل عکس است باید از OCR استفاده کرد.

محدود بودن دسترسی کپی در فایل

علت دیگر کپی نشدن متن PDF، محدود بودن دسترسی کپی در فایل است. بعضی PDFها تنظیمات امنیتی دارند و سازنده فایل اجازه کپی کردن متن را غیرفعال کرده است. در این حالت در مشخصات امنیتی فایل، گزینه Content Copying روی Not Allowed قرار دارد. یعنی مشاهده فایل ممکن است، اما کپی کردن متن از پی دی اف مجاز نیست.

کپی نشدن متن PDF

فونت یا کدگذاری متن 

گاهی هم مشکل کپی نشدن متن PDF از فونت یا کدگذاری متن است. در این حالت شاید بتوانید متن را انتخاب و کپی کنید، اما خروجی خراب می‌شود مثلاً حروف فارسی جدا از هم می‌آیند، ترتیب کلمات به‌هم می‌ریزد یا متن فارسی و انگلیسی در کنار هم درست نمایش داده نمی‌شود. این اتفاق در فایل‌های قدیمی، خروجی بعضی نرم‌افزارهای حسابداری، جزوه‌های تبدیل‌شده یا PDFهایی با فونت‌های غیراستاندارد، بیشتر دیده می‌شود.

از کجا بفهمیم PDF متنی است یا اسکن‌شده؟

تشخیص PDF متنی از PDF اسکن‌شده معمولاً ساده است. فایل را باز کنید و با ماوس یا انگشت روی چند کلمه بکشید. اگر کلمات جداگانه انتخاب می‌شوند و می‌توانید آن‌ها را کپی کنید، احتمالاً فایل شما PDF متنی است. در این حالت اگر متن درست کپی نمی‌شود، مشکل ممکن است به فونت، کدگذاری یا محدودیت دسترسی مربوط باشد.

اما اگر با کشیدن ماوس هیچ کلمه‌ای انتخاب نمی‌شود، یا کل صفحه مثل یک عکس رفتار می‌کند، احتمالاً با یک PDF اسکن‌شده روبه‌رو هستید. در این نوع فایل، متن واقعی در صفحه وجود ندارد و نرم‌افزار فقط تصویر صفحه را نشان می‌دهد. به همین دلیل، کپی کردن متن از PDF اسکن‌شده با روش معمول ممکن نیست.

یک راه ساده دیگر این است که صفحه را بزرگ‌نمایی کنید. اگر با زوم زیاد، نوشته‌ها مثل تصویر پیکسلی و دندانه‌دار دیده شوند، فایل احتمالاً تصویری یا اسکن‌شده است. 

تشخیص این تفاوت مهم است، چون راه‌حل هر کدام فرق می‌کند. برای PDF متنی، ممکن است تنظیمات فایل یا فونت را بررسی کنید؛ اما برای PDF اسکن‌شده، باید سراغ OCR PDF فارسی یا ابزار تبدیل PDF به متن بروید.

اگر PDF اسکن‌شده باشد، راه‌حل چیست؟

اگر فایل شما اسکن‌شده باشد، راه‌حل اصلی استفاده از OCR است. OCR مخفف Optical Character Recognition و به معنی تشخیص نوری کاراکترهاست. این فناوری نوشته‌های داخل تصویر، اسکن یا PDF تصویری را شناسایی می‌کند و آن‌ها را به متن قابل ویرایش، قابل کپی و قابل جست‌وجو تبدیل می‌کند.

به زبان ساده، OCR همان کاری را انجام می‌دهد که چشم و مغز ما هنگام خواندن تصویر انجام می‌دهند؛ با این تفاوت که نتیجه را به متن دیجیتال تبدیل می‌کند. مثلاً اگر یک صفحه از کتاب یا جزوه را اسکن کرده باشید، ابزار OCR می‌تواند خطوط و کلمات را تشخیص دهد و خروجی متنی تحویل دهد تا بتوانید آن را در Word، Google Docs، Notepad یا ابزارهای دیگر ویرایش کنید.

برای فایل‌های فارسی، کیفیت OCR اهمیت زیادی دارد. چون حروف فارسی به هم متصل‌اند، جهت متن راست‌به‌چپ است و گاهی عددهای فارسی و انگلیسی کنار هم می‌آیند. به همین دلیل، برای استخراج متن از PDF اسکن‌شده فارسی بهتر است از ابزاری استفاده شود که با متن فارسی سازگار باشد.

کپی نشدن متن PDF

استخراج متن از PDF اسکن شده با پیدیمو

اگر متن PDF انتخاب نمی‌شود یا فایل شما اسکن‌شده است، برای حل مشکل کپی نشدن متن PDF می‌توانید از ابزار تبدیل PDF به متن پیدیمو استفاده کنید. 

در این روش، فایل PDF را بارگذاری می‌کنید، ابزار محتوای صفحات را بررسی می‌کند و نوشته‌های داخل فایل را با کمک OCR تشخیص می‌دهد. سپس خروجی را می‌توانید به‌شکل متن قابل کپی یا فایل Word و TXT دریافت کنید. برای یادگیری دقیق‌تر این روش، سرویس تبدیل PDF به متن (OCR فارسی + انگلیسی) آنلاین را بخوانید. 

اگر متن فارسی بعد از کپی به‌هم برید یا کپی کردن قفل باشد راه حل چیست؟  

اگر متن فارسی بعد از کپی از PDF به‌هم می‌ریزد، اول چند راه ساده را امتحان کنید. 

متن را بدون قالب‌بندی در Notepad، Word یا Google Docs قرار دهید، جهت پاراگراف را روی راست‌به‌چپ بگذارید و اگر متن فارسی و انگلیسی مخلوط است، ترتیب عددها و عبارت‌های انگلیسی را جداگانه بررسی کنید. گاهی همین تغییر ساده مشکل نیم‌فاصله، ترتیب کلمات یا به‌هم‌ریختگی متن فارسی را کمتر می‌کند.

اگر مشکل ادامه داشت، احتمالاً PDF با فونت یا کدگذاری غیراستاندارد ساخته شده است. در این حالت، ظاهر فایل درست دیده می‌شود، اما متن داخلی آن برای کپی‌کردن سالم نیست. در این حالت فایل را با یک PDF Reader دیگر باز کنید یا آن را به Word تبدیل کنید.

اما اگر کپی کردن قفل باشد، موضوع فرق می‌کند و مشکل کپی نشدن متن PDF با روش های فوق حل نمی‌شود.

اگر فایل شما قفل شده است و یا با استفاده از روش‌های زیر، باز هم نمی‌توانید متن آن را استخراج کنید، ما در ادامه به شما یاد می‌دهیم چطور در چند مرحله متن را استخراج کنید. 

استخراج متن‌ پی دی اف قفل شده یا مشکل دار با پیدیمو

ممکن است فکر کنید که اگر متن فارسی یا انگلیسی بعد از کپی کردن به‌هم برید یا اصلا کپی‌کردن آن به دلیل قفل امکان‌پذیر نباشد، دیگر نمی‌توان کاری کرد. اما اینطور نیست. ممکن است کمی درد سر شما بیشتر شود، اما می‌توانید از یک روش جایگزین استفاده کنید: تبدیل صفحه‌ها به تصویر و سپس استخراج متن با OCR.

در این روش ابتدا از هر صفحه PDF عکس یا اسکرین‌شات واضح بگیرید. بهتر است صفحه را در بزرگ‌نمایی مناسب باز کنید تا نوشته‌ها ریز، تار یا بریده نباشند. اگر فایل چند صفحه دارد، از صفحه‌ها به ترتیب عکس بگیرید و نام آن‌ها را مرتب بگذارید؛ مثلاً page-01، page-02 و page-03. این کار باعث می‌شود هنگام ساخت فایل PDF جدید، ترتیب صفحه‌ها به‌هم نریزد.

در مرحله بعد، تصویر صفحه‌ها را در ابزار تبدیل عکس به PDF پیدیمو بارگذاری کنید. با این کار، عکس‌ها به یک فایل PDF اسکن‌شده و مرتب تبدیل می‌شوند. این فایل جدید از نظر فنی مثل یک PDF تصویری است؛ یعنی متن آن هنوز قابل انتخاب نیست، اما برای OCR آماده‌تر شده است.

حالا فایل PDF اسکن‌شده‌ای را که ساخته‌اید، در ابزار تبدیل PDF به متن پیدیمو قرار دهید. پیدیمو صفحه‌ها را بررسی می‌کند، نوشته‌های داخل تصاویر را با کمک OCR تشخیص می‌دهد و خروجی را به‌شکل متن قابل کپی یا فایل Word و TXT در اختیار شما می‌گذارد.

البته نتیجه نهایی به کیفیت عکس‌ها بستگی دارد؛ بنابراین بعد از استخراج متن، حتماً نام‌ها، عددها، تاریخ‌ها، مبلغ‌ها و بخش‌های مهم را بازبینی کنید.

کپی نشدن متن PDF

آیا استخراج متن از PDF همیشه دقیق است؟

خیر. استخراج متن از PDF همیشه صددرصد دقیق نیست. اگر فایل واضح، تک‌ستونه و دارای فونت استاندارد باشد، نتیجه معمولاً بهتر است. اما در اسکن‌های تار، دست‌خط ناخوانا، جدول‌های پیچیده، متن‌های چندستونه، فونت‌های تزئینی و عکس‌های سایه‌دار، احتمال خطا بیشتر می‌شود. بهتر است بعد از تبدیل PDF به متن، خروجی را کامل بررسی کنید؛ مخصوصاً اگر فایل رسمی، دانشگاهی، مالی یا حقوقی است.

نکاتی برای استخراج بهتر متن از PDF

برای اینکه استخراج متن از PDF فارسی نتیجه بهتری داشته باشد، کیفیت فایل ورودی بسیار مهم است. OCR قرار نیست از یک تصویر تار، کج یا کم‌نور خروجی بی‌نقص بسازد. هرچه فایل واضح‌تر و منظم‌تر باشد، احتمال تشخیص درست کلمات، عددها و نشانه‌ها بیشتر می‌شود.

اگر PDF از اسکن یا عکس ساخته شده، بهتر است تصویر صفحه واضح باشد. نوشته‌ها نباید تار، کشیده یا بیش‌ازحد کوچک باشند. اگر قرار است ابتدا از برگه عکس بگیرید و بعد آن را به PDF تبدیل کنید، دوربین را روبه‌روی صفحه نگه دارید و از زاویه عکس نگیرید. صفحه کج باعث می‌شود خطوط متن درست تشخیص داده نشوند و خروجی به اصلاح بیشتری نیاز داشته باشد.

نور و کنتراست هم مهم است. سایه دست، نور زرد، انعکاس روی کاغذ یا پس‌زمینه شلوغ می‌تواند تشخیص متن را سخت کند. بهتر است صفحه در نور یکنواخت قرار بگیرد و نوشته‌ها از پس‌زمینه کاملاً جدا باشند. برای متن‌های خیلی ریز، قبل از ساخت PDF یا قبل از تبدیل، کیفیت تصویر را بالاتر ببرید تا حروف بهتر دیده شوند.

در فایل‌های چندستونه، خروجی OCR را حتماً بازبینی کنید. گاهی ابزار تشخیص متن، ترتیب ستون‌ها را اشتباه می‌خواند یا بخشی از متن را جلوتر از بخش دیگر می‌آورد. 

جدول‌ها هم معمولاً به بررسی دستی نیاز دارند؛ چون بسیاری از ابزارهای تبدیل PDF به متن، محتوای جدول را به‌شکل متن خام استخراج می‌کنند و ممکن است لازم باشد جدول را دوباره در Word یا Excel مرتب کنید.

اگر فایل رسمی است، مثل قرارداد، فاکتور، سند اداری یا مقاله دانشگاهی، بعد از تبدیل PDF به متن حتماً اعداد، تاریخ‌ها، نام‌ها، مبلغ‌ها و اصطلاحات تخصصی را جداگانه بررسی کنید. خطای کوچک در این بخش‌ها می‌تواند معنای کل سند را تغییر دهد؛ پس بازبینی نهایی را مثل قفل آخر صندوقچه جدی بگیرید.

سؤالات متداول

چرا متن PDF انتخاب نمی‌شود؟

اگر متن PDF انتخاب نمی‌شود و مشکل کپی نشدن متن PDF وجود دارد، احتمالاً فایل شما اسکن‌شده یا تصویری است. همچنین ممکن است فایل توسط ایجاد کننده قفل شده باشد. برای چنین فایل‌هایی باید از OCR استفاده کنید تا نوشته‌های داخل تصویر به متن قابل ویرایش تبدیل شوند. 

آیا همه PDFها قابل کپی هستند؟

خیر. همه PDFها قابل کپی نیستند. بعضی فایل‌ها متنی‌اند و می‌توان نوشته‌های آن‌ها را انتخاب و کپی کرد، اما بعضی دیگر از اسکن و عکس ساخته شده‌اند و متن واقعی ندارند. در بعضی فایل‌ها هم ممکن است سازنده، امکان کپی کردن متن را محدود کرده باشد و یا به دلیل استفاده از کد، متن هنگام کپی به هم بریزد.

آیا PDF اسکن‌شده را می‌توان به متن تبدیل کرد؟

بله. PDF اسکن‌شده را می‌توان با کمک پیدیمو به متن تبدیل کرد. در این روش، ابزار تشخیص متن، نوشته‌های داخل تصویر را بررسی می‌کند و آن‌ها را به متن قابل کپی، قابل جست‌وجو و قابل ویرایش تبدیل می‌کند. 

اسکرول به بالا