PDF إلى TXT (OCR)

استخرج النص من مستندات PDF الممسوحة ضوئيًا إلى ملفات TXT عادية باستخدام OCR. تعرّف على النص في ملفات PDF المعتمدة على الصور ونزّله كملف نصي قابل للتحرير لمزيد من المعالجة.

اختر لغة النص ليتم التعرف على الأبجدية الصحيحة. الوضع التلقائي يتعرّف بنفسه على الأبجدية في كل صفحة.

PDF

أو اسحب الملف وأفلته هنا

ارفع ملف PDF

تحويل سريعمعالجة آمنةبدون تسجيل

ملف PDF واحد إلى ملف TXT

ارفع ملف PDF ممسوحًا ضوئيًا أو صورة فوتوغرافية. تقرأ تقنية OCR النص من البكسلات وتحوّله إلى أحرف قابلة للتحرير. تعمل مع النصوص المطبوعة بلغات متعددة، وتتعامل مع المسح الضوئي منخفض الجودة والصفحات المائلة والخطوط المتنوعة.

في الحالتين تحصل على ملف .txt واحد تُضاف فيه الصفحات بالترتيب مع فاصل يحدد كل فاصل صفحة، جاهز للحفظ أو البحث أو التمرير إلى سكربت؛ ولا يظهر في الملف النهائي أي فرق بين النص المستخرج والنص المتعرَّف عليه عبر OCR.

لماذا نتحقق من طبقة النص أولًا

المستندات الممسوحة ضوئيًا ليست سوى صور. لا يمكنك البحث فيها أو نسخ النص منها أو تحريرها. تحوّل تقنية OCR الصور إلى نص حقيقي، وتجعل الأرشيفات الورقية القديمة قابلة للبحث، وتتيح لك استخراج البيانات من النماذج الممسوحة ضوئيًا، وتحوّل المواد المطبوعة إلى ملفات قابلة للتحرير.

ضرورية لرقمنة العقود والإيصالات والوثائق التاريخية وصفحات الكتب. وتحتاج قارئات الشاشة إلى نص حقيقي لقراءته بصوت عالٍ—وتجعل تقنية OCR المستندات الممسوحة ضوئيًا في متناول ذوي الإعاقة. وهي توفر ساعات مقارنة بإعادة الكتابة اليدوية.

كيف تعرف ما لديك

إذا كان بإمكانك بالفعل تحديد ونسخ النص من ملف PDF في عارض عادي، فهذا يعني أنه يحتوي على طبقة نص، وستطابق مخرجات .txt ذلك النص المضمّن عن قرب، لأنه لا يوجد أي تخمين من OCR على الإطلاق؛ وتعتمد الدقة في تلك الحالة فقط على كيفية إنشاء ملف PDF أصلًا.

إذا كان النقر لتحديد النص يُبرز فقط مستطيلًا حول الصفحة بأكملها، أو لا يحدث شيء، فالصفحة صورة ممسوحة ضوئيًا ويعتمد محتوى .txt لها على جودة OCR؛ تحقق من دقة المسح ووضوح المستند الأصلي إذا كانت صفحة ممسوحة ضوئيًا تُقرأ بشكل أسوأ من المتوقع. يحافظ الجدول داخل ملف PDF يحمل طبقة نص بالفعل عادةً على قيم خلاياه بترتيب قراءة منطقي، لأن موضع كل حرف مخزَّن مباشرة في الملف، بينما يعتمد الجدول نفسه على صفحة ممسوحة ضوئيًا على قراءة تقنية OCR الصحيحة للأعمدة، لذا فإن فاتورة ممسوحة ضوئيًا أكثر عرضة لاحتياج إعادة محاذاة يدوية لاحقًا من فاتورة مُستخرجة مباشرة من ملف PDF أصلي.

الحصول على مخرجات TXT موثوقة

بالنسبة لملف PDF ممسوح ضوئيًا، فإن مسحًا بدقة أعلى في الإدخال يُنتج نصًا أنظف في الإخراج، مع كون 300 DPI أو أعلى هدفًا معقولًا إذا كنت أنت من يقوم بالمسح، لأن أي دقة أقل تبدأ في تكليف دقة OCR على النص الصغير.

بالنسبة لملف PDF يمزج صفحات أصلية وممسوحة ضوئيًا، تحقق من مخرجات .txt حول الحد الفاصل بين النوعين، لأن هذا هو المكان الوحيد الذي تتغيّر فيه المعالجة على مستوى الصفحة وحيث قد تُربك ترويسة أو تذييل غير معتاد ترتيب الصفحات في علامات الفاصل. يُكتب الملف بترميز UTF-8 مع فواصل أسطر بأسلوب Unix طوال الوقت، سواء جاءت صفحة معينة من استخراج مباشر أو من OCR، لذا لا يحتاج سكربت يقرأ النتيجة إلى معالجة منفصلة لنوعي صفحة المصدر بمجرد كتابة النص.