كنت شغال على Sentiment Analysis service …
الـ Architecture تمام.
الـ Performance تمام.
الـ Tests مفيهاش أي errors.
يعني كل الإشارات بتقول: “جاهز Production”.
فعملنا deploy.
وفي الأول… الدنيا كانت هادية بشكل مريب.
كل حاجة stable… وده في حد ذاته كان مخلي الواحد مطمئن زيادة عن اللزوم.
لحد ما حصل الـ plot twist، الـ Heavy load دخل على السيرفس دي تحديدًا.
وفجأة الـ system behavior اتغير تمامًا و الـ latency ولا كأنها بتسافر امريكا الجنوبيه والـ service اللي كانت “perfect” بدأت تنهار حرفيا تحت الضغط.
ساعتها مفيش سؤال غير واحد, إيه اللي بيحصل هنا ؟
فتحنا السيرفر… بصينا على الـ logs…
Core 1: 100% — fully saturated
Core 2: 99.4% — fully saturated
Core 0: 0.6% — نايم تقريبًا
Core 3: 3.9% — مش مستخدم أصلاً
كل حاجة كانت شغالة فعلا…
بس بشكل غلط.
وده كان أول hint إن المشكلة مش في الـ load… المشكلة في الـ distribution نفسه.
وده اللي غير كل تفكيرنا في الـ architecture بعدها.
قراءه ممتعه 😀
https://t.co/ttgIyLd5DA