کپی نشدن متن PDF یکی از مشکلات رایج هنگام کار با این فایلها است. گاهی فایل باز میشود، اما وقتی میخواهید بخشی از متن را انتخاب یا کپی کنید، هیچ اتفاقی نمیافتد یا متن کپیشده بههم میریزد. علت این مشکل همیشه یکسان نیست؛ ممکن است فایل اسکنشده باشد، امکان کپی در آن محدود شده باشد، فونت یا کدگذاری متن مشکل داشته باشد یا اصلاً نوشتههای داخل صفحه بهصورت تصویر ذخیره شده باشند.
مشکل از هر کجا که باشد، ما در این مقاله به شما یاد میدهیم که چگونه چنین متنهایی را استخراج کنید. اگر میخواهید بدانید که چرا متن PDF کپی نمیشود و چگونه آن را استخراج کنیم؟ این مقاله را از دست ندهید.

چرا متن PDF کپی نمیشود؟
برای حل مشکل کپی نشدن متن PDF، اول باید بفهمیم چرا متن کپی نمیشود؟
فایل PDF اسکنشده است
یکی از رایجترین علتها این است که فایل PDF، اسکنشده است. یعنی صفحههای یک کتاب، جزوه، قرارداد یا فاکتور اسکن شده و به PDF تبدیل شدهاند. در این نوع فایل، نوشتهها در واقع بخشی از تصویر هستند، نه متن قابل ویرایش. برای استخراج متن از PDF غیرقابل کپی که به شکل عکس است باید از OCR استفاده کرد.
محدود بودن دسترسی کپی در فایل
علت دیگر کپی نشدن متن PDF، محدود بودن دسترسی کپی در فایل است. بعضی PDFها تنظیمات امنیتی دارند و سازنده فایل اجازه کپی کردن متن را غیرفعال کرده است. در این حالت در مشخصات امنیتی فایل، گزینه Content Copying روی Not Allowed قرار دارد. یعنی مشاهده فایل ممکن است، اما کپی کردن متن از پی دی اف مجاز نیست.

فونت یا کدگذاری متن
گاهی هم مشکل کپی نشدن متن PDF از فونت یا کدگذاری متن است. در این حالت شاید بتوانید متن را انتخاب و کپی کنید، اما خروجی خراب میشود مثلاً حروف فارسی جدا از هم میآیند، ترتیب کلمات بههم میریزد یا متن فارسی و انگلیسی در کنار هم درست نمایش داده نمیشود. این اتفاق در فایلهای قدیمی، خروجی بعضی نرمافزارهای حسابداری، جزوههای تبدیلشده یا PDFهایی با فونتهای غیراستاندارد، بیشتر دیده میشود.
از کجا بفهمیم PDF متنی است یا اسکنشده؟
تشخیص PDF متنی از PDF اسکنشده معمولاً ساده است. فایل را باز کنید و با ماوس یا انگشت روی چند کلمه بکشید. اگر کلمات جداگانه انتخاب میشوند و میتوانید آنها را کپی کنید، احتمالاً فایل شما PDF متنی است. در این حالت اگر متن درست کپی نمیشود، مشکل ممکن است به فونت، کدگذاری یا محدودیت دسترسی مربوط باشد.
اما اگر با کشیدن ماوس هیچ کلمهای انتخاب نمیشود، یا کل صفحه مثل یک عکس رفتار میکند، احتمالاً با یک PDF اسکنشده روبهرو هستید. در این نوع فایل، متن واقعی در صفحه وجود ندارد و نرمافزار فقط تصویر صفحه را نشان میدهد. به همین دلیل، کپی کردن متن از PDF اسکنشده با روش معمول ممکن نیست.
یک راه ساده دیگر این است که صفحه را بزرگنمایی کنید. اگر با زوم زیاد، نوشتهها مثل تصویر پیکسلی و دندانهدار دیده شوند، فایل احتمالاً تصویری یا اسکنشده است.
تشخیص این تفاوت مهم است، چون راهحل هر کدام فرق میکند. برای PDF متنی، ممکن است تنظیمات فایل یا فونت را بررسی کنید؛ اما برای PDF اسکنشده، باید سراغ OCR PDF فارسی یا ابزار تبدیل PDF به متن بروید.
اگر PDF اسکنشده باشد، راهحل چیست؟
اگر فایل شما اسکنشده باشد، راهحل اصلی استفاده از OCR است. OCR مخفف Optical Character Recognition و به معنی تشخیص نوری کاراکترهاست. این فناوری نوشتههای داخل تصویر، اسکن یا PDF تصویری را شناسایی میکند و آنها را به متن قابل ویرایش، قابل کپی و قابل جستوجو تبدیل میکند.
به زبان ساده، OCR همان کاری را انجام میدهد که چشم و مغز ما هنگام خواندن تصویر انجام میدهند؛ با این تفاوت که نتیجه را به متن دیجیتال تبدیل میکند. مثلاً اگر یک صفحه از کتاب یا جزوه را اسکن کرده باشید، ابزار OCR میتواند خطوط و کلمات را تشخیص دهد و خروجی متنی تحویل دهد تا بتوانید آن را در Word، Google Docs، Notepad یا ابزارهای دیگر ویرایش کنید.
برای فایلهای فارسی، کیفیت OCR اهمیت زیادی دارد. چون حروف فارسی به هم متصلاند، جهت متن راستبهچپ است و گاهی عددهای فارسی و انگلیسی کنار هم میآیند. به همین دلیل، برای استخراج متن از PDF اسکنشده فارسی بهتر است از ابزاری استفاده شود که با متن فارسی سازگار باشد.

استخراج متن از PDF اسکن شده با پیدیمو
اگر متن PDF انتخاب نمیشود یا فایل شما اسکنشده است، برای حل مشکل کپی نشدن متن PDF میتوانید از ابزار تبدیل PDF به متن پیدیمو استفاده کنید.
در این روش، فایل PDF را بارگذاری میکنید، ابزار محتوای صفحات را بررسی میکند و نوشتههای داخل فایل را با کمک OCR تشخیص میدهد. سپس خروجی را میتوانید بهشکل متن قابل کپی یا فایل Word و TXT دریافت کنید. برای یادگیری دقیقتر این روش، سرویس تبدیل PDF به متن (OCR فارسی + انگلیسی) آنلاین را بخوانید.
اگر متن فارسی بعد از کپی بههم برید یا کپی کردن قفل باشد راه حل چیست؟
اگر متن فارسی بعد از کپی از PDF بههم میریزد، اول چند راه ساده را امتحان کنید.
متن را بدون قالببندی در Notepad، Word یا Google Docs قرار دهید، جهت پاراگراف را روی راستبهچپ بگذارید و اگر متن فارسی و انگلیسی مخلوط است، ترتیب عددها و عبارتهای انگلیسی را جداگانه بررسی کنید. گاهی همین تغییر ساده مشکل نیمفاصله، ترتیب کلمات یا بههمریختگی متن فارسی را کمتر میکند.
اگر مشکل ادامه داشت، احتمالاً PDF با فونت یا کدگذاری غیراستاندارد ساخته شده است. در این حالت، ظاهر فایل درست دیده میشود، اما متن داخلی آن برای کپیکردن سالم نیست. در این حالت فایل را با یک PDF Reader دیگر باز کنید یا آن را به Word تبدیل کنید.
اما اگر کپی کردن قفل باشد، موضوع فرق میکند و مشکل کپی نشدن متن PDF با روش های فوق حل نمیشود.
اگر فایل شما قفل شده است و یا با استفاده از روشهای زیر، باز هم نمیتوانید متن آن را استخراج کنید، ما در ادامه به شما یاد میدهیم چطور در چند مرحله متن را استخراج کنید.
استخراج متن پی دی اف قفل شده یا مشکل دار با پیدیمو
ممکن است فکر کنید که اگر متن فارسی یا انگلیسی بعد از کپی کردن بههم برید یا اصلا کپیکردن آن به دلیل قفل امکانپذیر نباشد، دیگر نمیتوان کاری کرد. اما اینطور نیست. ممکن است کمی درد سر شما بیشتر شود، اما میتوانید از یک روش جایگزین استفاده کنید: تبدیل صفحهها به تصویر و سپس استخراج متن با OCR.
در این روش ابتدا از هر صفحه PDF عکس یا اسکرینشات واضح بگیرید. بهتر است صفحه را در بزرگنمایی مناسب باز کنید تا نوشتهها ریز، تار یا بریده نباشند. اگر فایل چند صفحه دارد، از صفحهها به ترتیب عکس بگیرید و نام آنها را مرتب بگذارید؛ مثلاً page-01، page-02 و page-03. این کار باعث میشود هنگام ساخت فایل PDF جدید، ترتیب صفحهها بههم نریزد.
در مرحله بعد، تصویر صفحهها را در ابزار تبدیل عکس به PDF پیدیمو بارگذاری کنید. با این کار، عکسها به یک فایل PDF اسکنشده و مرتب تبدیل میشوند. این فایل جدید از نظر فنی مثل یک PDF تصویری است؛ یعنی متن آن هنوز قابل انتخاب نیست، اما برای OCR آمادهتر شده است.
حالا فایل PDF اسکنشدهای را که ساختهاید، در ابزار تبدیل PDF به متن پیدیمو قرار دهید. پیدیمو صفحهها را بررسی میکند، نوشتههای داخل تصاویر را با کمک OCR تشخیص میدهد و خروجی را بهشکل متن قابل کپی یا فایل Word و TXT در اختیار شما میگذارد.
البته نتیجه نهایی به کیفیت عکسها بستگی دارد؛ بنابراین بعد از استخراج متن، حتماً نامها، عددها، تاریخها، مبلغها و بخشهای مهم را بازبینی کنید.

آیا استخراج متن از PDF همیشه دقیق است؟
خیر. استخراج متن از PDF همیشه صددرصد دقیق نیست. اگر فایل واضح، تکستونه و دارای فونت استاندارد باشد، نتیجه معمولاً بهتر است. اما در اسکنهای تار، دستخط ناخوانا، جدولهای پیچیده، متنهای چندستونه، فونتهای تزئینی و عکسهای سایهدار، احتمال خطا بیشتر میشود. بهتر است بعد از تبدیل PDF به متن، خروجی را کامل بررسی کنید؛ مخصوصاً اگر فایل رسمی، دانشگاهی، مالی یا حقوقی است.
نکاتی برای استخراج بهتر متن از PDF
برای اینکه استخراج متن از PDF فارسی نتیجه بهتری داشته باشد، کیفیت فایل ورودی بسیار مهم است. OCR قرار نیست از یک تصویر تار، کج یا کمنور خروجی بینقص بسازد. هرچه فایل واضحتر و منظمتر باشد، احتمال تشخیص درست کلمات، عددها و نشانهها بیشتر میشود.
اگر PDF از اسکن یا عکس ساخته شده، بهتر است تصویر صفحه واضح باشد. نوشتهها نباید تار، کشیده یا بیشازحد کوچک باشند. اگر قرار است ابتدا از برگه عکس بگیرید و بعد آن را به PDF تبدیل کنید، دوربین را روبهروی صفحه نگه دارید و از زاویه عکس نگیرید. صفحه کج باعث میشود خطوط متن درست تشخیص داده نشوند و خروجی به اصلاح بیشتری نیاز داشته باشد.
نور و کنتراست هم مهم است. سایه دست، نور زرد، انعکاس روی کاغذ یا پسزمینه شلوغ میتواند تشخیص متن را سخت کند. بهتر است صفحه در نور یکنواخت قرار بگیرد و نوشتهها از پسزمینه کاملاً جدا باشند. برای متنهای خیلی ریز، قبل از ساخت PDF یا قبل از تبدیل، کیفیت تصویر را بالاتر ببرید تا حروف بهتر دیده شوند.
در فایلهای چندستونه، خروجی OCR را حتماً بازبینی کنید. گاهی ابزار تشخیص متن، ترتیب ستونها را اشتباه میخواند یا بخشی از متن را جلوتر از بخش دیگر میآورد.
جدولها هم معمولاً به بررسی دستی نیاز دارند؛ چون بسیاری از ابزارهای تبدیل PDF به متن، محتوای جدول را بهشکل متن خام استخراج میکنند و ممکن است لازم باشد جدول را دوباره در Word یا Excel مرتب کنید.
اگر فایل رسمی است، مثل قرارداد، فاکتور، سند اداری یا مقاله دانشگاهی، بعد از تبدیل PDF به متن حتماً اعداد، تاریخها، نامها، مبلغها و اصطلاحات تخصصی را جداگانه بررسی کنید. خطای کوچک در این بخشها میتواند معنای کل سند را تغییر دهد؛ پس بازبینی نهایی را مثل قفل آخر صندوقچه جدی بگیرید.
سؤالات متداول
چرا متن PDF انتخاب نمیشود؟
اگر متن PDF انتخاب نمیشود و مشکل کپی نشدن متن PDF وجود دارد، احتمالاً فایل شما اسکنشده یا تصویری است. همچنین ممکن است فایل توسط ایجاد کننده قفل شده باشد. برای چنین فایلهایی باید از OCR استفاده کنید تا نوشتههای داخل تصویر به متن قابل ویرایش تبدیل شوند.
آیا همه PDFها قابل کپی هستند؟
خیر. همه PDFها قابل کپی نیستند. بعضی فایلها متنیاند و میتوان نوشتههای آنها را انتخاب و کپی کرد، اما بعضی دیگر از اسکن و عکس ساخته شدهاند و متن واقعی ندارند. در بعضی فایلها هم ممکن است سازنده، امکان کپی کردن متن را محدود کرده باشد و یا به دلیل استفاده از کد، متن هنگام کپی به هم بریزد.
آیا PDF اسکنشده را میتوان به متن تبدیل کرد؟
بله. PDF اسکنشده را میتوان با کمک پیدیمو به متن تبدیل کرد. در این روش، ابزار تشخیص متن، نوشتههای داخل تصویر را بررسی میکند و آنها را به متن قابل کپی، قابل جستوجو و قابل ویرایش تبدیل میکند.
