مقیاس ملی با بار متمرکز در ساعات فعالیت کتابخانه‌ها

سامانه‌های نهاد کتابخانه‌های عمومی کشور در خدمت کتابخانه‌های سراسر ایران قرار دارند. اعضا و کتابخانه‌ها از این سامانه‌ها برای خدماتی مانند عضویت، امانت کتاب و جست‌وجوی منابع استفاده می‌کنند.

پیچیدگی پروژه فقط به حجم درخواست‌ها محدود نبود. بخش عمده مصرف سامانه بین ساعت ۸ تا ۱۷، هم‌زمان با فعالیت کتابخانه‌ها، اتفاق می‌افتد. بنابراین زیرساخت به‌جای یک بار یکنواخت در طول شبانه‌روز، باید حجم قابل‌توجهی از درخواست‌ها را در یک بازه زمانی فشرده مدیریت کند.

حجم چندترابایتی داده، حساسیت سرویس‌های سراسری و هماهنگی با چند تیم تخصصی در لایه‌های مختلف محصول نیز به پیچیدگی عملیاتی پروژه اضافه می‌کرد.

چالش: عبور از زیرساختی ناپایدار و محدود در مقیاس‌پذیری

پیش از آغاز همکاری، زیرساخت موجود در مدیریت سرورها، توزیع بار و توسعه ظرفیت با محدودیت روبه‌رو بود. نبود دید عملیاتی متمرکز نیز تشخیص سریع رخدادها و تصمیم‌گیری مبتنی بر داده را دشوار می‌کرد.

هدف پروژه تنها انتقال چند سرور به یک بستر جدید نبود. زیرساخت باید از نو طراحی می‌شد تا بتواند بار واقعی یک سامانه ملی را به‌شکل قابل‌پیش‌بینی مدیریت کند، از دیتابیس‌های بزرگ محافظت کند و به یک تیم عملیاتی مسئول امکان دهد پیش از تبدیل یک مشکل محدود به اختلال گسترده، اقدام کند.

طراحی مجدد و مهاجرت چند ترابایت داده با Cutover کنترل‌شده

دراپ تمپو زیرساخت جدید را از پایه روی بستر ابری طراحی و پیاده‌سازی کرد. معماری نهایی روی نزدیک به ۲۰ سرور ابری، با مجموع بیش از ۲۵۰ هسته پردازشی و ۹۰۰ گیگابایت حافظه اجرا شد تا ظرفیت لازم برای سرویس‌های مختلف و بار متمرکز روزانه فراهم شود.

مهاجرت چند ترابایت داده به‌صورت مرحله‌ای برنامه‌ریزی شد. انتقال نهایی سرویس‌ها در یک پنجره کنترل‌شده حدود شش‌ساعته، از ساعت ۱۸ تا نیمه‌شب، انجام شد؛ زمانی که کمترین تداخل را با ساعات فعالیت کتابخانه‌ها داشت.

معماری مقصد برای توزیع بار میان سرورهای سرویس‌دهنده طراحی شد و Replication دیتابیس‌ها نیز بخشی از طرح نهایی بود تا وابستگی به یک نمونه واحد کاهش پیدا کند.

از معماری و Hardening تا عملیات ۲۴/۷

دامنه مسئولیت دراپ تمپو طراحی معماری زیرساخت، مدیریت و به‌روزرسانی سرورها، Hardening، Load Balancing، Replication دیتابیس‌ها، مانیتورینگ، Alerting، لاگ مرکزی، امنیت شبکه و کنترل دسترسی را پوشش می‌دهد.

Prometheus و Grafana برای پایش و هشدار، ELK Stack برای تجمیع لاگ‌ها و k6 برای تست بار و ظرفیت به کار گرفته شدند. در لایه شبکه نیز pfSense، MikroTik و مسیرهای VPN برای ایجاد دسترسی‌های کنترل‌شده و مدیریت ترافیک استفاده می‌شوند.

پشتیبانی ۲۴/۷، Incident Response و بهبود مستمر زیرساخت پس از مهاجرت نیز بخشی از Scope جاری همکاری باقی مانده‌اند.

pfSense

Observability؛ از تشخیص فشار ظرفیت تا اقدام عملیاتی

برای زیرساختی در این مقیاس، صرفن روشن بودن سرورها به‌معنای سلامت سرویس نیست. دراپ تمپو لایه‌ای یکپارچه از متریک‌ها، هشدارها و لاگ‌های متمرکز ایجاد کرد تا وضعیت منابع، سرویس‌ها، ترافیک و دیتابیس‌ها به‌صورت پیوسته قابل‌مشاهده باشد.

این دید عملیاتی به تیم اجازه می‌دهد نشانه‌های افزایش بار یا اختلال را زودتر تشخیص دهد، علت را سریع‌تر پیدا کند و پیش از گسترش مسئله اقدام مناسب را انجام دهد.

در یکی از دوره‌های افزایش ناگهانی ترافیک، تیم با شناسایی سریع فشار ظرفیت، سرورهای سرویس‌دهنده بیشتری را وارد مدار کرد و بار را میان آن‌ها توزیع کرد. این مداخله سریع ظرفیت پاسخ‌گویی را افزایش داد و تداوم ارائه خدمات را در زمان اوج مصرف حفظ کرد.

امنیت چندلایه و حفاظت از داده‌ها

دسترسی‌های مدیریتی از مسیرهای کنترل‌شده و VPN انجام می‌شوند، ترافیک خروجی از Gateway مبتنی بر pfSense عبور می‌کند و Hardening سرورها و بازبینی دسترسی‌ها بخشی از عملیات مستمر است.

برای حفاظت از داده‌ها، Replication دیتابیس‌ها با یک برنامه پشتیبان‌گیری چندلایه ترکیب شده است. بکاپ‌های Incremental هر شب و Full Dumpها به‌صورت هفتگی تهیه می‌شوند و نسخه‌ها در Object Storage خارج از سرورهای عملیاتی نگهداری می‌شوند. این طراحی ریسک وابستگی به یک سیستم واحد را کاهش می‌دهد و آمادگی بازیابی را افزایش می‌دهد.

pfSense

نتایج قابل‌اندازه‌گیری در محیط واقعی

در یک بازه ۳۰روزه، زیرساخت نهاد کتابخانه‌های عمومی کشور بیش از ۱۵۲ میلیون درخواست CDN را مدیریت کرد، بیش از ۲.۵ ترابایت ترافیک را جابه‌جا کرد، بیش از ۶۶۰ هزار کاربر را در لایه CDN ثبت کرد و دسترس‌پذیری ۹۹.۹۵ درصدی داشت.

SLA پاسخ‌گویی به رخداد کمتر از ۱۵ دقیقه است و تیم عملیاتی ظرفیت زیرساخت را متناسب با الگوی واقعی مصرف ارزیابی و اصلاح می‌کند.

نتیجه فقط یک مهاجرت موفق نبود؛ نهاد اکنون روی بستری ابری، قابل‌مشاهده، محافظت‌شده و تحت مدیریت مستمر فعالیت می‌کند که ظرفیت و مالکیت عملیاتی لازم برای خدماتی در مقیاس ملی را دارد.

Retain: مسئولیت زیرساخت بعد از مهاجرت تمام نمی‌شود

نقش دراپ تمپو در Cutover به پایان نرسید. تیم ما همچنان عملیات روزمره، پایش ظرفیت، واکنش به رخداد، امنیت، بکاپ و بهبود مستمر این بستر را بر اساس الگوی واقعی مصرف مدیریت می‌کند.

این پروژه نشان می‌دهد پایداری در مقیاس ملی فقط با افزایش منابع سخت‌افزاری ساخته نمی‌شود. معماری درست، Observability، حفاظت از داده‌ها و حضور یک تیم باتجربه و پاسخ‌گو در تمام ساعات شبانه‌روز، منابع پردازشی را به یک بستر قابل‌اتکا برای خدمات عمومی تبدیل می‌کنند.

اگر سازمان شما یک پلتفرم پرترافیک یا حساس را اداره می‌کند، دراپ تمپو می‌تواند از ارزیابی و مهاجرت زیرساخت تا عملیات مدیریت‌شده ۲۴/۷ در کنار شما باشد.