به گزارش سایت خبری پُرسون، سرور تا زمانی که بدون مشکل کار میکند، کمتر مورد توجه قرار میگیرد؛ اما یک افزایش دما، خرابی هارد یا نوسان برق میتواند در مدت کوتاهی عملکرد سرویسهای وابسته را مختل کند. به همین دلیل، آشنایی با شرایط و نحوه نگهداری از سرور برای جلوگیری از خرابیهای ناگهانی و کاهش هزینههای تعمیر و توقف سرویس اهمیت زیادی دارد. نگهداری سرور فقط تمیز کردن دستگاه نیست و کنترل شرایط اتاق سرور، بررسی سلامت سختافزار، پایش منابع، وضعیت بکاپ، بهروزرسانی نرمافزارها، امنیت دسترسی و بررسی هشدارهای سیستم، همگی بخشی از یک برنامه نگهداری اصولی هستند. در ادامه، یک چکلیست ۱۰ موردی را بررسی میکنیم که با استفاده از آن میتوانید وضعیت سرور و زیرساخت اطراف آن را منظمتر بررسی و نشانههای خرابی را پیش از جدی شدن شناسایی کنید.
۱۰ نکته مهم برای نگهداری از سرور
نگهداری اصولی از سرور یعنی قبل از اینکه دستگاه از کار بیفتد، نشانههای خرابی یا کاهش عملکرد را شناسایی و برطرف کنید. بررسی دورهای دما، قطعات حساس، منابع، بکاپ، لاگها، سیستمعامل و امنیت، بخش مهمی از این فرایند است.
دما و تهویه اتاق سرور را کنترل کنید
دما یکی از مهمترین عوامل تأثیرگذار بر سلامت سرور است. پردازنده، حافظه، هارد و سایر قطعات هنگام کار گرما تولید میکنند و اگر این گرما بهدرستی از محیط خارج نشود، دمای تجهیزات افزایش پیدا میکند. ادامه این وضعیت میتواند باعث افت عملکرد، افزایش فشار روی قطعات و در بلندمدت کاهش عمر سختافزار شود. البته علاوه بر دمای خود سرور باید میزان گردش هوا در رک و اتاق سرور، عملکرد سیستم سرمایش و مسیر ورود و خروج هوای گرم را هم در نظر بگیرید.
سرور و تجهیزات را از گردوغبار دور نگه دارید
گردوغبار فقط ظاهر تجهیزات را خراب نمیکند؛ تجمع آن روی فنها و مسیرهای تهویه میتواند جریان هوا را مختل کرده و باعث افزایش دمای قطعات شود. وقتی فنها برای خنک کردن سرور با فشار بیشتری کار میکنند، احتمال افزایش دما و فرسودگی تجهیزات نیز بیشتر میشود. بنابراین در نحوه نگهداری از سرور تمیز نگه داشتن اتاق سرور، رک و تجهیزات باید بخشی از برنامه نگهداری باشد. در محیطهای پرگردوغبار یا مکانهایی که کنترل شرایط محیطی دشوار است، این بررسی اهمیت بیشتری پیدا میکند.
سلامت هاردها و RAID را بررسی کنید
خرابی هارد یکی از مشکلاتی است که اگر بهموقع شناسایی نشود، به یک بحران جدی تبدیل میشود. در سرورهای مجهز به RAID، وضعیت آرایه و دیسکهای تشکیلدهنده آن را بهصورت دورهای بررسی کنید و هشدارهای مربوط به خرابی یا کاهش سلامت دیسک را جدی بگیرید؛ زیرا اگر دیسک معیوب بهموقع تعویض نشود و قطعه دیگری نیز آسیب میبیند و بسته به نوع RAID ممکن است دسترسی به دادهها یا عملکرد سرویس تحت تأثیر قرار گیرد. در کنار سلامت دیسک، ظرفیت فضای ذخیرهسازی را هم بررسی کنید؛ زیرا پر شدن فضای دیسک میتواند باعث اختلال در سرویسها شود و حتی در برخی شرایط روی عملکرد پایگاه داده و سایر برنامهها اثر بگذارد.
از بکاپها فقط نسخه نگیرید؛ صحت آنها را بررسی کنید
داشتن بکاپ زمانی ارزش دارد که در لحظه نیاز بتوانید اطلاعات را بازیابی کنید. بنابراین باید مشخص کنید بکاپ در چه زمانی گرفته شده، چه اطلاعاتی در آن وجود دارد و آیا قابل بازیابی است یا خیر. یکی از خطاهای رایج این است که سازمان برای ماهها بکاپ تهیه میکند، اما هیچوقت بازیابی آن را آزمایش نمیکند. ممکن است فایل بکاپ ناقص باشد، تنظیمات اشتباه داشته باشد یا بخشی از اطلاعات موردنیاز در آن ذخیره نشده باشد.
وضعیت منابع سختافزاری را پایش کنید
کند شدن سرور همیشه به معنی خرابی یک قطعه نیست. گاهی سرور سالم است، اما بار کاری آن از ظرفیت سختافزار بیشتر شده است. به همین دلیل باید روند مصرف CPU، RAM، فضای ذخیرهسازی و شبکه را بررسی کنید. برای مثال، اگر مصرف CPU یا RAM به محدودههای بالا میرسد، ممکن است یک برنامه بار غیرعادی ایجاد کرده باشد یا سرور دیگر پاسخگوی حجم کاری فعلی نباشد. در چنین شرایطی ابتدا علت افزایش مصرف را پیدا کنید و سپس درباره بهینهسازی، ارتقای سختافزار یا اضافه کردن سرور تصمیم بگیرید.
سیستمعامل، Firmware و نرمافزارهای سرور را بهروز نگه دارید
بهروزرسانی فقط برای اضافه شدن قابلیتهای جدید نیست. بسیاری از بهروزرسانیها شامل اصلاح خطاها و وصلههای امنیتی هستند و میتوانند از سوءاستفاده از آسیبپذیریهای شناختهشده جلوگیری کنند. سیستمعامل، نرمافزارهای کاربردی و در صورت نیاز Firmware و درایورها باید در برنامه نگهداری سرور قرار بگیرند. با این حال، بهروزرسانی در محیط سرور نباید بدون برنامه انجام شود. پیش از نصب یک بهروزرسانی مهم، سازگاری آن با سیستمعامل، نرمافزارهای کاربردی و سختافزار را بررسی کنید. برای تغییرات حساس نیز از اطلاعات و تنظیمات مهم نسخه پشتیبان داشته باشید.
لاگها و هشدارهای سختافزاری را نادیده نگیرید
لاگها را میتوان به سابقه وضعیت سرور تشبیه کرد. بسیاری از مشکلات قبل از خرابی کامل، نشانههایی در لاگها ایجاد میکنند از خطای خواندن دیسک و مشکلات شبکه گرفته تا افزایش دما یا خطاهای حافظه. بررسی لاگها به شما کمک میکند متوجه شوید یک خطا اتفاقی بوده یا مرتب تکرار میشود. برای مثال، یک هشدار دیسک که چند بار در فاصله کوتاه تکرار شده، ارزش بررسی بیشتری دارد تا خطایی که یک بار و بدون تکرار ثبت شده است. هر هشداری به معنی خرابی قطعی نیست، اما هیچ هشدار تکرارشوندهای را بدون بررسی نباید رها نکنید.
منبع تغذیه و برق ورودی را بررسی کنید
سرور برای درست کار کردن به برق پایدار نیاز دارد. قطع برق، نوسان یا مشکل در منبع تغذیه میتواند باعث خاموش شدن ناگهانی سرور و در برخی شرایط آسیب یا از دست رفتن اطلاعات شود. به همین دلیل فقط وضعیت خود سرور را بررسی نکنید. در نحوه نگهداری از سرور سلامت Power Supply، اتصال کابلها، وضعیت UPS و عملکرد سیستم برق پشتیبان نیز باید در برنامه نگهداری قرار داشته باشد.
دسترسی فیزیکی و امنیت سرور را کنترل کنید
امنیت سرور فقط به آنتیویروس، فایروال یا رمز عبور محدود نمیشود. کسی که بتواند بدون کنترل وارد اتاق سرور یا رک شود، ممکن است به تجهیزات و زیرساخت دسترسی فیزیکی پیدا کند. به همین دلیل دسترسی به اتاق سرور را محدود و در صورت نیاز، ورود و خروج افراد را ثبت کنید. دسترسیهای مدیریتی را هم بهصورت دورهای بازبینی و حسابهایی را که دیگر استفاده نمیشوند حذف یا غیرفعال کنید. بررسی حسابهای کاربری و مجوزهای دسترسی نیز بخشی از نگهداری سرور است.
برای نگهداری سرور یک برنامه دورهای داشته باشید
بزرگترین اشتباه این است که نگهداری را به زمانی موکول کنید که سرور دچار مشکل شده است. بهتر است از قبل مشخص کنید چه کسی، چه چیزی را و در چه بازهای بررسی میکند. در ادامه یک برنامه ساده برای شرایط و نحوه نگهداری از سرور را آماده کردهایم. البته براساس نوع سرور، حجم کار، حساسیت سرویسها و سیاستهای سازمان میتوانید این برنامه را تغییر دهید.
|
دوره بررسی |
موارد پیشنهادی نگهداری از سرور |
|
روزانه یا مداوم |
هشدارها، دما، وضعیت سرویسها و رخدادهای مهم |
|
هفتگی |
مصرف CPU، RAM، دیسک، شبکه و لاگهای مهم |
|
ماهانه |
وضعیت RAID، بکاپ و سلامت سختافزار |
|
دورهای |
تمیزکاری، Firmware، UPS، دسترسیها و بررسی امنیت |
از کجا بفهمیم سرور به نگهداری یا بررسی تخصصی نیاز دارد؟
گاهی نشانههای خرابی واضح نیستند. سرور ممکن است هنوز روشن باشد و سرویسها هم کار کنند، اما یک مشکل در حال شکلگیری باشد. در چنین شرایطی، توجه به تغییرات غیرعادی میتواند جلوی خرابی بزرگتر را بگیرد. اگر یکی از موارد زیر را مشاهده میکنید، بهتر است موضوع را جدیتر بررسی کنید:
- افزایش غیرعادی یا مداوم دمای سرور
- هشدارهای تکرارشونده سختافزاری
- خطاهای خواندن یا نوشتن دیسک
- هشدار RAID یا شناسایی دیسک معیوب
- افت محسوس عملکرد سرور
- افزایش مداوم مصرف CPU یا RAM
- پر شدن فضای ذخیرهسازی
- خاموش شدن یا راهاندازی مجدد غیرمنتظره
- اختلالهای مکرر شبکه
- شکست عملیات بکاپ یا ناموفق بودن تست بازیابی
- ...
نگهداری از سرور در یک نگاه
نگهداری سرور یک کار یکباره نیست فرایندی دورهای است که با هدف حفظ پایداری، عملکرد و امنیت زیرساخت انجام میشود. کنترل دما و تهویه، جلوگیری از تجمع گردوغبار، بررسی دیسک و RAID، تست بکاپ، پایش CPU و RAM، بهروزرسانی نرمافزار و Firmware، بررسی لاگها، کنترل برق و UPS و مدیریت دسترسیها، همگی بخشی از این فرایند هستند.
اگر این بررسیها را در یک برنامه مشخص قرار دهید، مشکلات جدی برای سرورتان بوجود نمیآید. در عین حال، هر مشکلی را نباید صرفاً با یک چکلیست عمومی حل کنید زمانی که هشدارهای سختافزاری تکرار میشوند، عملکرد سرور افت میکند یا خرابیهای مشابه چند بار اتفاق میافتند، باید سرور را به صورت تخصصی بررسی کنید.
همچنین برای آشنایی بیشتر با نکات تخصصی سرور، شبکه، امنیت و زیرساخت IT، فالنیک یک وبینار تخصصی با موضوع وبینار تابآوری زیرساخت در روزهای سخت توسط فالنیک (ایران اچ پی) برگزار میشود و از راه های زیر میتوانید با فالنیک در ارتباط باشید و در این وبینار ثبت نام کنید:
لینک ثبت نام:
تلفن: ۸۳۶۳-۰۲۱
آدرس: تهران، میدان فردوسی، خیابان ایرانشهر جنوبی، روبروی اداره پست، پلاک ۱۶ (ساختمان ایران اچ پی)
ایمیل: info@falnic.com
منبع: فالنیک (ایران اچ پی)