OCR لملفات PDF: إنشاء PDF قابل للبحث
التعرف على ملف PDF ممسوح ضوئيًا وإضافة نص قابل للتحديد بالإنجليزية أو الإسبانية أو الروسية. الحدود: 10 صفحات و10 MiB للملف. تبقى الملفات داخل المتصفح.
ملفات التعرف ≈ 26 MB عند أول استخدام، بالإضافة إلى بيانات اللغة.
النص المتعرف عليه
هل كانت هذه الأداة مفيدة؟
تجربة مثال
تنزيل ملف نموذجيإبقاء اللغة المحددة «العربية». تنزيل ملف PDF والبحث عن «فاتورة» و148.50 و«سارة أحمد» و2048. ينبغي أن تبدو الصفحتان مثل النموذج، مع نص يمكن تحديده ونسخه.
النتيجة المتوقعة
يتم التعرف على كل صفحة كصورة، بالترتيب. تتوفر اللغة الإنجليزية والروسية والتعرف المختلط. قد يخطئ OCR في قراءة الحروف والأرقام والأعمدة والجداول؛ لذا ينبغي مراجعة النتيجة. ينتج عن ذلك PDF جديد من صور الصفحات المعروضة وطبقة نصية غير مرئية. يبقى حجم الصفحة المرئي وتدويرها كما هما؛ ولا يتم الاحتفاظ بالنماذج والروابط والإشارات المرجعية والمرفقات والتواقيع الرقمية. يُعاد التعرف على النص الموجود؛ وتتحدد جودة الصورة بدقة العرض.
يتم عرض كل صفحة بدقة تصل إلى 4 ميغابكسل. يستغرق التحميل وكل خطوة معالجة حتى 90 ثانية؛ وتتوقف المهمة بالكامل بعد 10 دقائق. تُعلَّم الصفحات الفارغة في النص. لا يُعرض التنزيل إذا فشلت المعالجة أو لم يتم التعرف على أي نص.
هل الملف محمي بكلمة مرور؟يلزم إلغاء قفله أولًا بكلمة المرور الخاصة به.
قد يؤدي التشغيل الأول إلى تنزيل ملفات المحول ويستغرق بعض الوقت. إذا فشلت العملية، يمكن التحقق من الاتصال أو تجربة ملف أصغر. يوقف زر «إلغاء» المعالجة الجارية؛ ويمكن اختيار ملف آخر وإعادة المحاولة.
تراخيص المحركات والشيفرة المصدرية
دليل عملي
إدخال ممسوح ضوئيًا وإخراج PDF قابل للبحث.
- اختيار ملف PDF ممسوح ضوئيًا في حدود 10 صفحات و10 MiB.
- تحديد الإنجليزية أو الإسبانية أو الروسية.
- البحث في ملف PDF الناتج عن كلمة معروفة للتحقق من الطبقة النصية.
تجربة هذا المثال
التعرف على فاتورة ممسوحة ضوئيًا عدد صفحاتها 2 بالإنجليزية؛ ينبغي أن يعثر البحث عن رقم الفاتورة عليه مميزًا في ملف PDF الناتج.
قبل البدء: لا تُدعم سوى الإنجليزية والإسبانية والروسية، في حدود 10 صفحات و10 MiB؛ وتنخفض دقة التعرف في المسوحات منخفضة الجودة.