🔎 OCR

استخراج النص من صورة أو PDF مصوّر

Arabic OCR for Students

محاضرة مصوّرة بالهاتف، كتاب ممسوح ضوئياً، أو ملف PDF لا تستطيع تحديد حرف واحد منه. في كل هذه الحالات لا يوجد نص أصلاً — توجد صور فقط. واستخراج النص منها يحتاج تقنية اسمها OCR، ونتيجتها في العربية تعتمد على شيء واحد أكثر من أي شيء آخر: جودة الصورة التي تعطيها.

أولاً: هل ملفك مصوّر أم نصّي؟

هذا أول ما يجب أن تعرفه، لأن العلاج مختلف تماماً. الاختبار يستغرق ثانيتين: افتح الملف وحاول تحديد سطر بالفأرة.

واختبار ثانٍ أدق: ابحث داخل الملف عن كلمة تراها بعينك على الشاشة. إن لم يجدها البحث، فما تراه صورة لا نص.

وهناك حالة ثالثة تخدع كثيرين: ملف مختلط — صفحاته الأولى نصّية والباقي صور ممسوحة، أو صفحة نصّية فيها جدول مُدرج كصورة. لذلك افحص عدة صفحات لا صفحة واحدة.

لماذا العربية أصعب على OCR؟

دقة استخراج النص العربي أقل من الإنجليزي، والسبب في بنية اللغة نفسها لا في تقصير الأدوات:

ولهذا فإن تحسين الصورة يرفع الدقة في العربية أكثر بكثير مما يرفعها في الإنجليزية — وهذه أهم نقطة عملية في هذا الدليل.

كيف تصوّر الصفحة بشكل يرفع الدقة

أغلب النتائج السيئة سببها الصورة لا الأداة. القواعد الخمس التي تصنع الفرق:

وإن توفّر ماسح ضوئي فاستخدمه بدقة 300 نقطة في البوصة على الأقل. وإن كنت تصوّر بالهاتف، فأغلب أنظمة الهاتف فيها وضع «مسح مستند» يصحّح الزاوية والإضاءة تلقائياً — استخدمه بدل التصوير العادي.

راجع الناتج في هذه المواضع

لا يوجد OCR بدقة مئة بالمئة، والمراجعة جزء من العملية لا استثناء فيها. وبدل قراءة كل شيء، ركّز على ما يخطئ فيه عادة:

وطريقة مراجعة سريعة: اقرأ الناتج بصوت عالٍ. الخطأ الذي لا تلتقطه العين تلتقطه الأذن فوراً لأن الجملة تتعثّر.

أين تفيدك هذه التقنية

الاستخدام الأشيع بين الطلبة هو تحويل المحاضرات المصوّرة إلى نص يمكن البحث فيه وتلخيصه — وهذه وحدها توفّر ساعات وقت المراجعة. وتفيد كذلك في اقتباس فقرة من كتاب ممسوح بدل إعادة كتابتها يدوياً، وفي استخراج بيانات جدول من ورقة مطبوعة، وفي جعل ملف قديم قابلاً للبحث بالكلمة المفتاحية.

وانتبه إلى حقوق المصدر: استخراج النص لا يلغي الحاجة إلى الاستشهاد. إن استخدمت فقرة من كتاب في بحثك، وثّقها كما توثّق أي اقتباس مهما كانت طريقة حصولك عليها.

استخرج النص من ملفاتك المصوّرة

أدوات PDF في DoocuAI تستخرج النص من الصور والملفات الممسوحة مع دعم العربية، وتعطيك نصاً قابلاً للنسخ والتعديل — ثم يمكنك تلخيصه أو تحويله إلى تقرير مباشرة.

🔎 جرّب استخراج النص مجاناً

أسئلة شائعة

كيف أعرف أن ملف PDF مصوّر وليس نصياً؟

حاول تحديد سطر بالفأرة. إن لم تستطع تحديد أي حرف فالملف مصوّر. واختبار ثانٍ: ابحث داخل الملف عن كلمة تراها بعينك؛ إن لم يجدها البحث فهو مصوّر.

لماذا دقة OCR العربي أقل من الإنجليزي؟

لأن العربية خط متصل يتغيّر شكل حرفه حسب موقعه، ولأن التنقيط يفرّق بين حروف متطابقة الرسم. نقطة باهتة تكفي لتبديل كلمة، لذلك جودة الصورة تؤثر في العربية أكثر بكثير.

كيف أرفع دقة استخراج النص؟

صوّر من فوق مباشرة بإضاءة موزّعة بلا ظل ولا انعكاس، واملأ الإطار بالصفحة وحدها، وثبّت الكاميرا. وإن توفّر ماسح ضوئي فاستخدمه بدقة 300 نقطة في البوصة على الأقل.

هل يحافظ OCR على تنسيق الصفحة؟

يحافظ على النص لا على التنسيق غالبًا. العناوين والجداول والأعمدة قد تتحوّل إلى سطور متتالية، ولذلك يُفضّل استخدام الناتج كنص خام تعيد تنسيقه بنفسك، خصوصًا في الجداول.

اقرأ أيضًا