اسأل روبوت محادثة ذكاء اصطناعي عام سؤالاً عن مستند رفعته، وستحصل على إجابة واثقة وحسنة الصياغة. تظهر المشكلة عندما تحتاج فعلاً إلى الوثوق بتلك الإجابة في أمر مهم — لا توجد طريقة للتحقق من مصدرها دون إعادة قراءة المستند كاملاً بنفسك، وهذا بالضبط ما كان يُفترض أن يوفره عليك السؤال أصلاً.
البحث الدلالي يجد المعنى لا الكلمات المفتاحية فقط
البحث بالكلمات المفتاحية يفوّت الأسئلة المصاغة بكلمات مختلفة عن النص الأصلي. يفهرس EnergyFile المستندات باستخدام تضمينات متجهية (vector embeddings) بدلاً من ذلك — يُرمّز كل جزء من ملف PDF أو جدول بيانات أو عرض تقديمي بحيث يمكن للسؤال أن يطابق فقرة حتى لو لم تستخدم أياً من الكلمات نفسها. هذا ما يجعل سؤال «ما مدى تعرضنا لخط الأنابيب الشمالي» يجد فقرة لا تذكر كلمة «تعرض» إطلاقاً.
الإجابة بلا استشهاد مجرد تخمين بصياغة جيدة
الجزء المهم فعلاً: كل إجابة تأتي مع استشهاد على مستوى الصفحة يشير إلى المستند المصدر. لا تأخذ كلام الذكاء الاصطناعي على محمل الثقة — تنقر على الاستشهاد وتقرأ الفقرة الدقيقة التي استُخرجت منها. إذا لم يقل الاستشهاد ما تدّعيه الإجابة، تعرف ذلك فوراً، لا بعد ثلاثة قرارات لاحقة.
OCR يعني أن ملفات PDF الممسوحة ضوئياً تُحتسب أيضاً
الكثير من مكتبات البحث نصفها نص قابل للبحث ونصفها صفحات ممسوحة ضوئياً لم تخضع أبداً لـ OCR، ما يعني أن نصف المكتبة غير مرئي لأي أداة بحث. يشغّل EnergyFile OCR عند إدخال المستند، فتصبح دراسة ممسوحة ضوئياً من خمس سنوات قابلة للبحث تماماً مثل شيء كُتب البارحة.