في المكتبات والأرشيفات العربية، تتراكم ذاكرة واسعة من الكتب والصحف والمخطوطات والوثائق التي جرى تصويرها وحفظها رقميا. لكن الانتقال من الورق إلى الشاشة لا يعني أن هذه الذاكرة أصبحت حاضرة في العالم الرقمي، إذ تظل الصفحة المصورة بالنسبة للحاسوب مجرد صورة وليست نصا. ولا يستطيع محرك البحث أو نموذج الذكاء الاصطناعي قراءتها أو فهرستها بالطريقة نفسها التي يتعامل بها مع النصوص القابلة للقراءة الآلية.
من صورة محفوظة إلى بيانات قابلة للقراءة
لا يتوقف الانتقال من صفحة ورقية إلى مادة يفهمها الذكاء الاصطناعي عند المسح الضوئي، بل يعتمد على تقنيات التعرف الضوئي على الحروف (OCR) للtexts المطبوعة، وتقنيات التعرف على الكتابة اليدوية (HTR) للمخطوطات والوثائق التاريخية.
تحتاج هذه الأنظمة إلى ضخ كميات ضخمة من البيانات لتدريبها. وفي هذا السياق، برزت مجموعة “سرد” (SARD) التي نشرها باحثون من جامعة الأمير سلطان وأكاديمية طويق السعودية عام 2026. تحتوي هذه المجموعة على نحو 2.6 مليون صورة لصفحات عربية تضم 794.6 مليون كلمة، صُممت خصيصا لتدريب واختبار أنظمة التعرف على النصوص في صفحات تحاكي تخطيطات الكتب.
رغم أهمية هذه البيانات الاصطناعية التي توفر نصوصا مرجعية دقيقة دون الحاجة لتفريغ يدوي مكلف، فإنها لا تغطي بالكامل تعقيدات الأرشيف التاريخي الحقيقي وعيوب الوثائق القديمة.
تحديات قراءة الوثائق العربية القديمة
يؤكد الخبراء، مثل المهندس حمدي مبارك من معهد قطر لبحوث الحوسبة، أن قراءة الوثائق العربية القديمة تواجه عقبات معقدة تتجاوز مجرد التعرف على الحروف المفردة:
- حالة الوثيقة: ضعف جودة المسح الضوئي، اصفرار الورق أو تلفه، بقع الحبر، وعدم انتظام الصفحات.
- خصائص اللغة: تشابك الحروف العربية، غياب التشكيل، اختلاف أشكال الخطوط والطباعة القديمة، واستخدام تهجئات تاريخية تختلف عن الاستخدام الحديث.
- تعقيد التصميم: تحتوي الصحف القديمة على أعمدة متعددة، عناوين، إعلانات، وحواشي متداخلة، مما يجعل التعرف على الكلمات وحدها غير كافٍ لاستعادة الصفحة الأصلية.
- حساسية الأخطاء: خطأ بسيط في حرف واحد قد تحول الكلمة إلى كلمة أخرى صحيحة لغوياً لكنها مختلفة تماماً في المعنى التاريخي أو السياقي.
مخاطر انتقال أخطاء “أو سي آر” إلى الذكاء الاصطناعي
استخراج النص عبر تقنيات “أو سي آر” يمثل الخطوة الأولى فقط، إذ يتطلب المحتوى ضبطاً للجودة والتنظيف والتوصيف قبل استخدامه. وعندما تتكرر أخطاء الاستخراج عبر ملايين الصفحات، فإنها تشكل مخاطر حقيقية:
- تحول الأسماء أو التواريخ أو الأرقام المشوهة إلى جزء من بيانات تدريب النماذج التوليدية باعتبارها صيغاً صحيحة.
- عجز أنظمة استرجاع المعلومات عن العثور على الوثائق المستهدفة بسبب أخطاء مطبعية في المصطلحات أو الأسماء.
لذلك، لا تقاس جودة رقمنة التراث العربي بعدد الصفحات المحولة إلى نصوص فحسب، بل بمدى أمانة النص المستخرج للمصدر الأصلي، والاحتفاظ ببنية الوثيقة، وربط النص المستخرج بصورته الأصلية للتحقق البشري أو الآلي عند الحاجة.



