طرحت شركة Expedia Group أداة Service Telemetry Analyzer (STAR)، وهي عبارة عن منصة داخلية لإمكانية المراقبة بمساعدة الذكاء الاصطناعي تساعد المهندسين على التحقيق في حوادث الإنتاج من خلال تحليل قياس الخدمة عن بعد وإنشاء تقييمات منظمة للسبب الجذري. يجمع النظام بين المقاييس التشغيلية ونماذج اللغات الكبيرة (LLMs) من خلال مسارات عمل تشخيصية محددة مسبقًا، بهدف تقليل الوقت الذي يقضيه المهندسون في تحديد مصدر تدهور الخدمة مع إبقاء البشر مسؤولين عن التحقق من الصحة واتخاذ القرار.

بدلاً من اعتماد عوامل الذكاء الاصطناعي المستقلة، تتبع المنصة سير عمل حتمي يتم من خلاله جمع القياس عن بعد، وتحليله باستخدام المطالبات الخاصة بالمجال، ودمجها في نتائج وسيطة، وتلخيصها في تقرير نهائي يحتوي على الأسباب الجذرية المحتملة والخطوات التالية الموصى بها.

وفي وصف هدف المشروع، كتب الفريق،

كان هدفنا من هذه الخدمة هو تقليل وقت المعرفة (TTK) ووقت الاسترداد (TTR).

STAR Architecture (المصدر: منشور مدونة Expedia)

يتم تنفيذ النظام الأساسي كتطبيق FastAPI الذي يتكامل مع Datadog لاسترداد مقاييس الخدمة وبوابة الذكاء الاصطناعي الداخلية المولدة التي تدير المصادقة والوصول إلى موفري LLM. يستخدم سير العمل تسلسلاً سريعًا، مما يسمح بإجراء تحليلات متخصصة متعددة قبل إنتاج تشخيص موحد. قالت Expedia إن التنفيذ الحالي لا يستخدم إمكانات مثل استدعاء الوظائف، أو توليد الاسترجاع المعزز (RAG)، أو الذاكرة، أو استخدام الأدوات المستقلة، بدلاً من الاعتماد على سير عمل محدد مسبقًا لإنشاء تحليلات متسقة.

تركز STAR على القياس عن بعد للبنية التحتية الموحدة التي تم جمعها من الخدمات المستندة إلى Kubernetes وتطبيقات JVM. يقوم النظام بتحليل المقاييس بما في ذلك إنتاجية الطلب، ووقت الاستجابة، ومعدلات أخطاء HTTP، وgRPC، وGraphQL، واستخدام وحدة المعالجة المركزية والذاكرة، وأحداث إعادة تشغيل الحاوية، وفشل اختبار الاستعداد والحيوية في Kubernetes، واستخدام كومة Java، ونشاط جمع البيانات المهملة. توضح Expedia أن مقاييس البنية التحتية توفر رؤية متسقة عبر الخدمات التي تم تطويرها باستخدام لغات وأطر برمجة مختلفة.

مع تطور النظام الأساسي، استبدلت شركة Expedia مهام خلفية FastAPI بمهام يعتمد على الكرفس بنية غير متزامنة تستخدم Redis كوسيط للرسائل وواجهة خلفية للنتيجة. يذكر الفريق الهندسي أن معظم المعالجة تتكون من عمليات إدخال/إخراج مرتبطة باسترجاع القياس عن بعد وطلبات LLM. يسمح نموذج التنفيذ غير المتزامن لـ STAR بمعالجة مهام التحليل المتعددة بشكل متزامن مع استيعاب حدود المعدل التي تفرضها Datadog وبوابة الذكاء الاصطناعي الداخلية للشركة.

تفيد الشركة أنه تم استخدام STAR لدعم التحقيقات في حوادث الإنتاج، وتحليل ما بعد الحادث، واستكشاف أخطاء Kubernetes وإصلاحها، وتشخيصات ذاكرة JVM. يقوم المهندسون بمراجعة النتائج التي تم التوصل إليها قبل التصرف بناءً على التوصيات، مما يجعل المنصة أداة مساعدة بدلاً من نظام تشغيلي مستقل.

تصف المدونة أيضًا العمل المستمر لتوسيع المنصة. تتضمن التحسينات المخطط لها دمج معلومات تبعية الخدمة، وبيانات التعريف التشغيلية الإضافية، وتكامل الأدوات المستندة إلى بروتوكول السياق النموذجي (MCP)، وواجهات المحادثة. تقوم Expedia أيضًا بتقييم STAR كجزء من ممارساتها الهندسية الفوضوية للمساعدة في تحليل نتائج تجارب الفشل الخاضعة للرقابة. يتم حاليًا دعم الإدارة السريعة والتتبع والتقييم من خلال Langfuse، بينما يتم تقييم أداء النظام باستخدام مراجعات الخبراء في الموضوع وتعليقات المستخدمين.



شاركها.
اترك تعليقاً