تبقى الملفات على الجهاز

تُعالَج الملفات في المتصفح ولا تُرفع إلى خوادمنا. قد ينزّل الموقع محركات المعالجة ويرسل أحداث الاستخدام أو الملاحظات دون محتوى الملفات.

كيف نتعامل مع البيانات →
كل أدوات PDF

PDF إلى نص

استخراج النص من PDF قابل للبحث إلى نسخة نصية عادية لإعادة الاستخدام. يُستخرج النص الموجود فقط، دون الخطوط والصور والصفحات الممسوحة ضوئيًا.

مثال اصطناعي — يُرجى مراجعة إعدادات العملية قبل التشغيل.

تبقى المستندات على هذا الجهاز. لا تتضمن عمليات تنزيل الأدوات وإحصاءات الاستخدام محتوى الملفات.

الحدود على الجهاز: الحد الأقصى للملف الواحد: 10 MB

تُعالج الملفات داخل المتصفح. لا تُرفع إلى هذا الموقع.

دليل عملي

الحصول على النص دون تحويل تصميم الصفحة.

  1. اختيار ملف PDF ذي نص قابل للتحديد.
  2. استخراج النص ومراجعة الناتج المفصول بحسب الصفحات.
  3. نسخ TXT أو تنزيله، ثم التحقق من المقاطع المهمة في ملف PDF.

تجربة هذا المثال

استخراج النص من حزمة اجتماع قابلة للبحث من ست صفحات ومقارنة عناوين جدول الأعمال وبنود الإجراءات بالمصدر قبل مشاركة ملف TXT.

قبل

  • نص PDF قابل للتحديد

بعد

  • نص عادي بصيغة .txt
المدخلات والنتيجة المتوقعة لهذه المهمة. مثال توضيحي.

قبل البدء: يحتوي الناتج على نص لا على الخطوط الأصلية ولا الصور ولا التخطيط؛ ولا يجري التعرف على الصفحات الممسوحة ضوئيًا.

المتابعة بملف PDF المصدر
ما الذي يتم الحصول عليه

استخراج النص المضمّن إلى ملف TXT. تحتاج الصفحات الممسوحة ضوئيًا إلى OCR؛ وقد يختلف ترتيب القراءة في المصدر عن التخطيط المرئي.

الحدود والتفاصيل المهمة

10 MiB كحد أقصى للمدخلات، و200 صفحة، و4 MiB لمخرجات النص. تُبلغ المستندات الممسوحة ضوئيًا التي تفتقر إلى طبقة نصية عن خطأ بدلًا من استخراج ناجح زائف. قد لا يطابق ترتيب القراءة والأعمدة والخطوط التخطيط المرئي. هذا ليس OCR وليس تحويلًا من PDF إلى Word.

مثال

استخراج النص من تقرير قابل للبحث، ومراجعته في حقل النتيجة، ثم نسخه أو تنزيله. تبقى ملفات PDF الأصلية متاحة بعد نتيجة النص.