مقیاس ملی با بار متمرکز در ساعات فعالیت کتابخانهها
سامانههای نهاد کتابخانههای عمومی کشور در خدمت کتابخانههای سراسر ایران قرار دارند. اعضا و کتابخانهها از این سامانهها برای خدماتی مانند عضویت، امانت کتاب و جستوجوی منابع استفاده میکنند.
پیچیدگی پروژه فقط به حجم درخواستها محدود نبود. بخش عمده مصرف سامانه بین ساعت ۸ تا ۱۷، همزمان با فعالیت کتابخانهها، اتفاق میافتد. بنابراین زیرساخت بهجای یک بار یکنواخت در طول شبانهروز، باید حجم قابلتوجهی از درخواستها را در یک بازه زمانی فشرده مدیریت کند.
حجم چندترابایتی داده، حساسیت سرویسهای سراسری و هماهنگی با چند تیم تخصصی در لایههای مختلف محصول نیز به پیچیدگی عملیاتی پروژه اضافه میکرد.
چالش: عبور از زیرساختی ناپایدار و محدود در مقیاسپذیری
پیش از آغاز همکاری، زیرساخت موجود در مدیریت سرورها، توزیع بار و توسعه ظرفیت با محدودیت روبهرو بود. نبود دید عملیاتی متمرکز نیز تشخیص سریع رخدادها و تصمیمگیری مبتنی بر داده را دشوار میکرد.
هدف پروژه تنها انتقال چند سرور به یک بستر جدید نبود. زیرساخت باید از نو طراحی میشد تا بتواند بار واقعی یک سامانه ملی را بهشکل قابلپیشبینی مدیریت کند، از دیتابیسهای بزرگ محافظت کند و به یک تیم عملیاتی مسئول امکان دهد پیش از تبدیل یک مشکل محدود به اختلال گسترده، اقدام کند.
طراحی مجدد و مهاجرت چند ترابایت داده با Cutover کنترلشده
دراپ تمپو زیرساخت جدید را از پایه روی بستر ابری طراحی و پیادهسازی کرد. معماری نهایی روی نزدیک به ۲۰ سرور ابری، با مجموع بیش از ۲۵۰ هسته پردازشی و ۹۰۰ گیگابایت حافظه اجرا شد تا ظرفیت لازم برای سرویسهای مختلف و بار متمرکز روزانه فراهم شود.
مهاجرت چند ترابایت داده بهصورت مرحلهای برنامهریزی شد. انتقال نهایی سرویسها در یک پنجره کنترلشده حدود ششساعته، از ساعت ۱۸ تا نیمهشب، انجام شد؛ زمانی که کمترین تداخل را با ساعات فعالیت کتابخانهها داشت.
معماری مقصد برای توزیع بار میان سرورهای سرویسدهنده طراحی شد و Replication دیتابیسها نیز بخشی از طرح نهایی بود تا وابستگی به یک نمونه واحد کاهش پیدا کند.
از معماری و Hardening تا عملیات ۲۴/۷
دامنه مسئولیت دراپ تمپو طراحی معماری زیرساخت، مدیریت و بهروزرسانی سرورها، Hardening، Load Balancing، Replication دیتابیسها، مانیتورینگ، Alerting، لاگ مرکزی، امنیت شبکه و کنترل دسترسی را پوشش میدهد.
Prometheus و Grafana برای پایش و هشدار، ELK Stack برای تجمیع لاگها و k6 برای تست بار و ظرفیت به کار گرفته شدند. در لایه شبکه نیز pfSense، MikroTik و مسیرهای VPN برای ایجاد دسترسیهای کنترلشده و مدیریت ترافیک استفاده میشوند.
پشتیبانی ۲۴/۷، Incident Response و بهبود مستمر زیرساخت پس از مهاجرت نیز بخشی از Scope جاری همکاری باقی ماندهاند.
Observability؛ از تشخیص فشار ظرفیت تا اقدام عملیاتی
برای زیرساختی در این مقیاس، صرفن روشن بودن سرورها بهمعنای سلامت سرویس نیست. دراپ تمپو لایهای یکپارچه از متریکها، هشدارها و لاگهای متمرکز ایجاد کرد تا وضعیت منابع، سرویسها، ترافیک و دیتابیسها بهصورت پیوسته قابلمشاهده باشد.
این دید عملیاتی به تیم اجازه میدهد نشانههای افزایش بار یا اختلال را زودتر تشخیص دهد، علت را سریعتر پیدا کند و پیش از گسترش مسئله اقدام مناسب را انجام دهد.
در یکی از دورههای افزایش ناگهانی ترافیک، تیم با شناسایی سریع فشار ظرفیت، سرورهای سرویسدهنده بیشتری را وارد مدار کرد و بار را میان آنها توزیع کرد. این مداخله سریع ظرفیت پاسخگویی را افزایش داد و تداوم ارائه خدمات را در زمان اوج مصرف حفظ کرد.
امنیت چندلایه و حفاظت از دادهها
دسترسیهای مدیریتی از مسیرهای کنترلشده و VPN انجام میشوند، ترافیک خروجی از Gateway مبتنی بر pfSense عبور میکند و Hardening سرورها و بازبینی دسترسیها بخشی از عملیات مستمر است.
برای حفاظت از دادهها، Replication دیتابیسها با یک برنامه پشتیبانگیری چندلایه ترکیب شده است. بکاپهای Incremental هر شب و Full Dumpها بهصورت هفتگی تهیه میشوند و نسخهها در Object Storage خارج از سرورهای عملیاتی نگهداری میشوند. این طراحی ریسک وابستگی به یک سیستم واحد را کاهش میدهد و آمادگی بازیابی را افزایش میدهد.
نتایج قابلاندازهگیری در محیط واقعی
در یک بازه ۳۰روزه، زیرساخت نهاد کتابخانههای عمومی کشور بیش از ۱۵۲ میلیون درخواست CDN را مدیریت کرد، بیش از ۲.۵ ترابایت ترافیک را جابهجا کرد، بیش از ۶۶۰ هزار کاربر را در لایه CDN ثبت کرد و دسترسپذیری ۹۹.۹۵ درصدی داشت.
SLA پاسخگویی به رخداد کمتر از ۱۵ دقیقه است و تیم عملیاتی ظرفیت زیرساخت را متناسب با الگوی واقعی مصرف ارزیابی و اصلاح میکند.
نتیجه فقط یک مهاجرت موفق نبود؛ نهاد اکنون روی بستری ابری، قابلمشاهده، محافظتشده و تحت مدیریت مستمر فعالیت میکند که ظرفیت و مالکیت عملیاتی لازم برای خدماتی در مقیاس ملی را دارد.
Retain: مسئولیت زیرساخت بعد از مهاجرت تمام نمیشود
نقش دراپ تمپو در Cutover به پایان نرسید. تیم ما همچنان عملیات روزمره، پایش ظرفیت، واکنش به رخداد، امنیت، بکاپ و بهبود مستمر این بستر را بر اساس الگوی واقعی مصرف مدیریت میکند.
این پروژه نشان میدهد پایداری در مقیاس ملی فقط با افزایش منابع سختافزاری ساخته نمیشود. معماری درست، Observability، حفاظت از دادهها و حضور یک تیم باتجربه و پاسخگو در تمام ساعات شبانهروز، منابع پردازشی را به یک بستر قابلاتکا برای خدمات عمومی تبدیل میکنند.
اگر سازمان شما یک پلتفرم پرترافیک یا حساس را اداره میکند، دراپ تمپو میتواند از ارزیابی و مهاجرت زیرساخت تا عملیات مدیریتشده ۲۴/۷ در کنار شما باشد.