HERO في WSI: اختبار نموذج الأساس عندما تتغير الصبغة والماسح والمختبر

في كثير من المختبرات يبدأ مشروع AI بطريقة بسيطة: لدينا WSI كثيرة، ولدينا أرشيف H&E، ونريد نموذجا يساعد في triage أو grading أو biomarker prediction. المشكلة تظهر بعد الخطوة الأولى. النموذج الذي يعطي نتيجة جيدة على صور مختبر واحد قد يتعامل مع مختبر آخر بطريقة مختلفة بسبب scanner، الصبغة، طريقة التحضير، أو توزيع الحالات.

هذه الفروقات جزء من العمل اليومي. طبيب الباثولوجي يرى أثرها في اللون، التركيز، folds، thickness، ونوعية المسح قبل أن يراها أي AI model. لذلك فإن السؤال العملي عند تقييم pathology foundation model يبدأ من الثبات تحت اختلافات المختبر، ثم ينتقل إلى أرقام الأداء على المهمة النهائية.

ورقة HERO المنشورة على arXiv تتعامل مع هذه النقطة مباشرة. HERO هو Histology Encoder مبني على ViT-G/14، درب على نحو 500 مليون tile مأخوذة من حوالي 575 ألف WSI سريرية. الفكرة الأساسية في التدريب أن العينة لا تؤخذ حسب كثافة الصور في الأرشيف فقط، لأن ذلك يجعل morphology الشائعة تحصل على وزن أكبر. استخدم الفريق طريقة sampling مبنية على clusters بصرية حتى يكون التدريب أقرب إلى توزيع morphology متوازن.

أين تهم هذه الورقة لطبيب الباثولوجي؟

أي AI model يدخل مسار WSI السريري يعتمد على encoder في مرحلة ما. قد يكون ذلك واضحا في biomarker prediction، وقد يكون مخفيا داخل أداة triage أو أداة بحث عن مناطق مشابهة أو model مبني فوق features جاهزة. إذا كان encoder يحمل بصمة المركز أو scanner داخل التمثيل، فإن النموذج اللاحق يرث هذه البصمة.

في المختبر، يرفع هذا متطلبات التحقق قبل التشغيل. يحتاج القسم إلى معرفة ما يحدث عند تغيير scanner، أو عند اختلاف صبغة H&E بين موقعين، أو عند استعمال النموذج على cohort من مؤسسة أخرى. HERO يقدم طريقة مفيدة لقياس هذه الأسئلة، من غير أن يحولها إلى جواب سريري نهائي.

ما الذي اختبره الباحثون؟

التقييم اعتمد على ست مجموعات benchmarks عامة. الجزء الأهم لطبيب الباثولوجي هو قياس ثبات التمثيل أمام اختلاف المركز والماسح والصبغة، لأن متوسط الأداء في classification أو segmentation قد يخفي أثر مصدر الصورة.

في PathoROB، يقيس الاختبار هل أقرب الجيران داخل embedding space يتشاركون biology أم يتشاركون مصدر الصورة. HERO حقق متوسط RI قدره 0.892 عبر Camelyon وTCGA 2×2 وTolkach ESCA. للمقارنة، Virchow2 سجل 0.861، وH-Optimus-1 سجل 0.814، بينما Phikon-v2 سجل 0.469. في Camelyon تحديدا كان الفرق واضحا: HERO وصل إلى 0.836، بينما Phikon-v2 وصل إلى 0.019. قراءة هذا الرقم عملية جدا: بعض encoders قد تجمع الصور حسب المستشفى قبل أن تجمعها حسب metastasis status.

في PLISM، استخدم الباحثون نسيجا متطابقا أعيد مسحه أو أعيدت صبغته تحت شروط مختلفة. HERO سجل cosine similarity قدره 0.933، وحقق Top-10 retrieval accuracy قدرها 0.793 مع تغيير scanner، و0.424 مع تغيير stain، و0.280 عند الجمع بين التغييرين. المتوسط كان 0.607، مقابل 0.480 لأقرب نموذج في هذا الجدول. تغير الصبغة كان أصعب من تغير scanner، وهي ملاحظة يعرفها كل من راجع slides من مختبرات متعددة.

الأداء العام بقي مهما

الثبات وحده معيار ناقص. النموذج الذي يقاوم اختلاف الصبغة يحتاج أيضا إلى أداء مقبول في المهام الأساسية حتى يفيد المختبر. لذلك اختبر الفريق HERO على classification، segmentation، gene-expression prediction، و39 مهمة slide-level عبر Patho-Bench.

في EVA، وهو benchmark للمهام tile-level وبعض مهام WSI، كان متوسط HERO 0.780. UNI2 سجل 0.793، وVirchow2 سجل 0.786. هذا يضع HERO ضمن المجموعة القوية، مع أفضلية أكبر له في اختبارات الثبات. في HEST الخاص بتوقع gene expression من tiles، سجل HERO متوسط Pearson r قدره 0.404، بينما H-Optimus-1 سجل 0.423 وUNI2 سجل 0.414. هذه أرقام قريبة، وتعني أن التحسين في الثبات لم يأت على حساب انهيار واضح في تمثيل morphology.

في Patho-Bench، شملت المهام subtyping، grade، mutation prediction، treatment response، وsurvival prediction. HERO سجل متوسط 0.673 عبر 39 مهمة، متقدما على UNI2 عند 0.665 وUNI عند 0.655. كان الأفضل في 15 مهمة من أصل 39. هذه نتيجة مهمة للباحثين ومطوري أدوات AI، لكنها تبقى preprint وتحتاج قراءة حذرة قبل أي استخدام سريري.

الدرس العملي للمختبر

عند شراء أو تطوير AI model مبني على pathology foundation model، يجب أن يطلب المختبر تقريرا واضحا عن acquisition shift. الأسئلة العملية محددة: كم scanner استعمل في التدريب؟ هل توجد بيانات من مختبر خارجي؟ هل تم اختبار اختلاف الصبغة؟ هل تم فصل patient-level split؟ هل توجد نتائج حسب organ، grade، tissue type، ومصدر WSI؟

طبيب الباثولوجي يحتاج أيضا إلى رؤية أمثلة فشل. المتوسطات تخفي الحالات التي تهم التوقيع اليومي: necrosis واسع، tissue ضعيف، صبغة باهتة، focus غير مستقر، أو specimen صغير. إذا كان النموذج يعطي heatmap أو score، يجب أن يكون الخطأ قابلا للمراجعة داخل viewer، وأن يرتبط بالحالة الأصلية في LIS أو image management system.

في بيئات العراق والمنطقة، هذه النقطة أكثر حساسية. المختبرات قد تستخدم scanners مختلفة، وقد تكون الصبغات بين المواقع غير موحدة تماما. أي نموذج يستند إلى بيانات خارجية يحتاج اختبارا محليا قبل أن يدخل triage أو report support. اختبار محلي صغير ومنظم قد يكشف مشكلة لا تظهر في paper أو vendor demo.

كيف أقرأ HERO داخل سياق العمل السريري؟

HERO يقدم اتجاه بحث مفيد: الحجم وحده لا يحل مشكلة اختلاف المختبر. طريقة اختيار tiles، توازن morphology، وقياس أثر scanner والصبغة يجب أن تدخل في تقييم أي foundation model. الورقة technical report على arXiv، وتحتاج validation سريري وقراءة prospective داخل workflow تشخيصي قبل تحويل نتائجها إلى قرار تشغيل.

الاستخدام الأقرب اليوم هو في فرق البحث والتطوير، أو في مختبر يريد بناء validation plan قبل تشغيل أدوات AI فوق WSI. يمكن استعمال أفكار الورقة لتصميم checklist داخلي: قياس ثبات features، اختبار بيانات من scanner آخر، مقارنة performance قبل وبعد stain variation، وتوثيق الحالات التي يختلف فيها النموذج عن توقع طبيب الباثولوجي.

بهذه الطريقة تصبح ورقة HERO أقل عن سباق أسماء النماذج، وأكثر عن سؤال عملي في المختبر: هل يقرأ AI morphology أم يقرأ أثر المختبر الذي أنتج الصورة؟ الإجابة على هذا السؤال يجب أن تسبق أي نقاش عن دمج النموذج في sign-out أو biomarker workflow.

المصدر: arXiv 2609.35943v1