برای مدیران سیستم:XRISS DDR4 32GB 2666MHz RDIMM ECC یک ماژول جایگزینی و گسترش برای اکوسیستم حافظه سرور ECC ثبت شده DDR4 است.در زیر روشهای تأیید و نظارتی است که برای راه اندازی شرکت توصیه می کنیم..
این RDIMM از IC های DRAM x4 سازمان یافته با ECC کامل 72 بیتی (64 داده + 8 ECC) استفاده می کند. بافری ثبت شده بار الکتریکی را از حدود 18 بار (UDIMM) به 2 بار کاهش می دهد.امکان کار با سرعت کامل با تمام کانال های حافظه پر شدههر ماژول قبل از حمل، 72 ساعت سوختگی در 55 درجه سانتیگراد را با تست تزریق خطای ECC مداوم عبور می کند.اطمینان از اینکه نه تنها IC های DRAM بلکه تراشه ثبت و مسیرهای سیگنال مرتبط با آن در شرایط حرارتی پایدار مرکز داده قابل اعتماد هستند.
برای خوشه های VMware vSphere این ماژول در پیکربندی های vSAN تمام فلش که در آن خطاهای حافظه می تواند لایه کش vSAN را خراب کند ، تأیید شده است. برای Proxmox VE با ZFS ،حفاظت ECC تضمین می کند که محاسبات چک سوم در ARC Cache به طور قابل تایید درست است.برای سرورهای پایگاه داده فلزی که PostgreSQL یا MySQL را اجرا می کنندECC از سناریوی فساد داده های خاموش جلوگیری می کند که در آن یک خطای یک بیت در استخر بافر در طول نقطه کنترل بعدی به دیسک گسترش می یابد.
سوال ۱. چگونه می توانم نرخ خطای ECC را در یک سرور لینوکس اجرا کنم تا مشکلات حافظه را قبل از اینکه باعث خرابی شوند، تشخیص دهم؟
A: نصب و پیکربندی rasdaemon (RAS - قابلیت اطمینان، در دسترس بودن، سرویس پذیری daemon) که در مخازن همه توزیع های اصلی لینوکس در دسترس است.`ras-mc-ctl --summary` تعداد خطاهای قابل اصلاح و غیرقابل اصلاح را در هر DIMM نشان می دهد. يک اشتباه درست شده در ماه به خاطر تشعشع پس زمینه نرمال و قابل انتظار استیک روند رو به افزایش از یک خطا/ماه به یک خطا/هفته به یک خطا/روز نشان می دهد که یک سلول DRAM در حال تخریب است و ماژول باید به طور فعال جایگزین شود.اکثر BMC های سرور (iDRAC ، iLO ، XClarity) همچنین خطاهای حافظه را ردیابی می کنند و می توانند برای ارسال تله های SNMP یا هشدار های ایمیل هنگامی که نرخ خطای قابل اصلاح از آستانه های قابل تنظیم فراتر رود تنظیم شوند.برای VMware ESXi، نظارت بر سلامت سخت افزار vCenter عملکرد معادل را از طریق ارائه دهنده CIM فراهم می کند.
Q2. آیا این RDIMM می تواند در یک مادربرد رومیزی مصرف کننده که از ECC پشتیبانی می کند (مانند برخی از ASRock یا ASUS) استفاده شود؟
A: نه RDIMM (DIMM ثبت شده) از نظر الکتریکی با مادربرد های رومیزی مصرف کننده ناسازگار هستند.تراشه بافر ثبت شده بر روی ماژول نیاز به پشتیبانی خاص از کنترل کننده حافظه و BIOS، که فقط در سیستم عامل های سرور و ایستگاه کاری (Intel Xeon E5/E7/Scalable، AMD EPYC و برخی از سری Intel Xeon E-2300 با تراشه C256) وجود دارد.مادربرد های مصرف کننده که پشتیبانی ECC را تبلیغ می کنند (معمولا AMD AM4 / AM5 با پردازنده های Ryzen غیر APU) نیاز به ECC UDIMM (Unbuffered DIMM با ECC) دارند، نه RDIMM. محصول ECC UDIMM ما (55610999) ماژول درست برای این سیستم عامل ها است. نصب RDIMM در یک اسلات UDIMM منجر به حالت بدون POST و بدون آسیب خواهد شد،اما سیستم به سادگی راه اندازی نمی شود.
Q3. تفاوت بین سازمان DRAM x4 و x8 برای حافظه سرور چیست و چرا مهم است؟
A: سازمان x4 به این معنی است که هر تراشه DRAM 4 بیت به هر کلمه داده کمک می کند، به 18 تراشه برای یک کلمه ECC 72 بیتی (64 داده + 8 ECC) نیاز دارد. سازمان x8 از 8 بیت در هر تراشه استفاده می کند، تنها به 9 تراشه نیاز دارد.سازمان x4 استاندارد برای حافظه سرور سازمانی است زیرا انعطاف پذیری بالاتر از شکست تراشه را فراهم می کند: اگر یک تراشه x4 به طور کامل شکست بخورد، تنها 4 بیت داده تحت تأثیر قرار می گیرند و موتور ECC می تواند این را از نظر نظری اصلاح کند (یک قابلیت 'chipkill' یا SDDC). اگر یک تراشه x8 شکست بخورد، 8 بیت تحت تأثیر قرار می گیرند،که از قابلیت تصحیح 8 بیتی ECC فراتر می رود و منجر به یک خطا غیر قابل تصحیح می شود. این ماژول از IC های DRAM سازمان یافته x4 استفاده می کند ، به همین دلیل مناسب است برای مستقر کردن سرورهای مهم که در آن انعطاف پذیری شکست تک تراشه مورد نیاز است.
سوال ۴: سرور ما ۳ سال است که بدون یک خطای ECC کار می کند. آیا این به این معنی است که ECC در واقع هیچ کاری نمی کند؟
پاسخ: نه، این به این معنی است که ECC به طور کامل کار می کند و به آرامی خطاهایی را اصلاح می کند که هرگز نیازی به دانستن آنها ندارید. نرخ خطای DRAM آماری است:یک سیستم در سطح دریا با 256GB DDR4 تجربه تقریبا 0.5-2 اشتباهات قابل تصحیح در روز به طور متوسط. این واقعیت که شما هیچ خطای گزارش شده را ندیده اید ممکن است به این معنی باشد:(1) نظارت شما برای گزارش خطاهای قابل اصلاح تنظیم نشده است (تشخیص پیکربندی rasdaemon)، (2) سرور شما در یک محیط کم تابش پس زمینه است (مرکز داده زیرزمینی، محفظه سرب پوشیده شده) ، (3) دسته خاص DRAM شما دارای ویژگی های خطای بهتر از متوسط است ،یا (4) اشتباهات به سادگی در زیر آستانه گزارش از تنظیم خاص نظارت شما است.عدم وجود خطاهای گزارش شده نشان نمی دهد که ECC غیرضروری است بلکه نشان می دهد که سیستم به درستی کار می کند.اولین بار که شما یک خطای غیر قابل اصلاح که ECC تشخیص می دهد را مشاهده می کنید (از فساد داده های خاموش جلوگیری می کند که می تواند یک پایگاه داده یا سیستم فایل را خراب کند) زمانی است که ارزش ECC به طور ملموس آشکار می شود.
س5: آیا می توانم از این ماژول برای گسترش حافظه در یک سرور Dell PowerEdge استفاده کنم که در حال حاضر از حافظه گواهی شده Dell استفاده می کند؟
A: بله، مخلوط کردن XRISS RDIMM با حافظه گواهی شده Dell پشتیبانی می شود، اگرچه برای عملکرد بهینه توصیه می کنیم از دستورالعمل های جمعیت سرور خود برای پیکربندی متعادل پیروی کنید.ملاحظات کلیدی: (1) سرعت را مطابقت دهید: اگر حافظه موجود شما 2666MHz باشد، این ماژول در 2666MHz کار می کند؛ اگر موجود 2400MHz باشد، تمام ماژول ها در 2400MHz کار می کنند.(2) تطبیق سازمان رتبه بندی (یک رتبه در مقابل. دو رتبه) در صورت امکان، زیرا مخلوط کردن رتبه ها می تواند بر متراکم شدن حافظه تأثیر بگذارد؛(۳) سرورهای Dell PowerEdge ممکن است یک رویداد غیرمهم را در Log Controller Lifecycle ثبت کنند. این فقط برای اطلاعات است و بر عملکرد یا ضمانت تاثیر نمی گذارد.. سیاست گارانتی دِل نیازی به استفاده از حافظه ی گواهینامه ی دِل ندارد