سفر از 8 مگابایت رم EDO در یک Pentium MMX به 64 گیگابایت DDR5 در یک ماژول واحد در یک ایستگاه کاری هوش مصنوعی تنها سه دهه طول می کشد.درک این تکامل توضیح می دهد که چرا ماژول XRISS 64GB DDR5 5600MHz نشان دهنده یک نقطه تغییر واقعی برای بارهای کار محاسباتی متصل به حافظه است.
چرا 64GB روی یک UDIMM مهم است:نمونه سازی مدل هوش مصنوعی در ایستگاه های کاری چهار GPU نیاز به نگهداری کل مجموعه داده های پیش پردازش شده در RAM سیستم دارد در حالی که GPU VRAM دسته آموزش فعال را اداره می کند.یک مجموعه داده های تقسیم بندی تصویر معمولی با 100،000 1024x1024 تصاویر پزشکی مصرف می کند حدود 40-55GB در حافظه پس از پیش پردازش.ماژول XRISS 64GB این بار کار را بر روی یک مادربرد مصرفی 4 اسلات (256GB در کل) بدون نیاز به سیستم عامل های سرور RDIMM گران قیمت امکان پذیر می کندفرکانس 5600 مگاهرتز تضمین می کند که CPU 32 هسته ای هرگز در طول افزایش داده های حیاتی و خط لوله آماده سازی دسته ای که GPU ها را تغذیه می کند، از پهنای باند گرسنه نیست.
Q1. چگونه DDR5 on-die ECC از ECC سرور سنتی متفاوت است و آیا این ماژول حفاظت کامل از مسیر داده را فراهم می کند؟
A: DDR5 on-die ECC و ECC سنتی سطح سیستم به اهداف مختلفی خدمت می کنند.آن را تشخیص می دهد و تصحیح اشتباهات تک بیت که در داخل آرایه DRAM خود رخ می دهداین امر قابلیت اطمینان ذاتی DRAM را بهبود می بخشد اما از خطاهای در اتوبوس حافظه بین ماژول و CPU محافظت نمی کند.ECC سطح سیستم کامل (که این UDIMM غیر ECC ارائه نمی دهد) یک تراشه DRAM اضافی در هر رتبه و منطق تصحیح خطا در کنترل کننده حافظه را اضافه می کند، حفاظت از کل مسیر داده از انتهای به انتهای برای نمونه سازی AI و بار کار تحقیقاتی که در آن اشتباهات گاهی اوقات در مجموعه داده های آموزش از نظر آماری بی اهمیت هستند،ECC در DDR5 UDIMM یکپارچگی داده کافی را فراهم می کند.برای خدمات نتیجه گیری تولید یا محاسبات مالی، سیستم عامل های کامل ECC RDIMM توصیه می شود.
س2: با 64 گیگابایت در یک ماژول، آیا می توانم چهار اسلات را برای 256 گیگابایت در یک مادربرد مصرف کننده پر کنم؟
A: بله، این یکی از موارد اصلی استفاده از این ماژول است. در یک مادربرد مصرفی استاندارد 4DIMM (Z790، X670E، B650) ، چهار ماژول XRISS 64GB 256GB RAM سیستم را در 5600MHz فراهم می کند. با این حال،ملاحظات عملی وجود داره: (1) پیکربندی 4-DIMM در 5600MHz نیاز به یک مادربرد با مسیر ردیابی حافظه قوی دارددر حالی که 6 لایه بودجه ممکن است نیاز به کاهش به 5200MHz یا 4800MHz برای ثبات2) کنترل کننده حافظه یکپارچه CPU (IMC) عامل محدود کننده است ✓ رانندگی 4 DIMM دو رتبه در 5600MHz حتی IMC های بالای بن را تحت فشار قرار می دهد و ممکن است نیاز به افزایش اندکی ولتاژ VDD و VDDQ داشته باشید.(3) خنک کننده CPU شما نباید با اسلات های DIMM نزدیک ترین به سوکت تداخل داشته باشدما توصیه می کنیم تست با MemTest86 برای حداقل 2 عبور کامل قبل از استقرار یک پیکربندی 256GB برای بار تولید.
سوال 3: چه نوع بار کاری هوش مصنوعی در واقع نیاز به 64 گیگابایت+ رم سیستم دارد وقتی که GPU دارای VRAM خود است؟
A: رایج ترین سناریو پردازش اولیه داده ها برای یادگیری عمیق است. قبل از شروع آموزش، مجموعه داده های خام (تصاویر، متن، داده های سنسور) باید بارگیری، تمیز کردن، افزایش،و به فرمت های تنسور تبدیل می شوند که GPU می تواند مصرف کند. يک مجموعه داده هاي تصويري پزشکي با 100000 اسکن CT با وضوح 512x512 حدود 40-65GB حافظه را پس از بارگیری و پیش پردازش مصرف می کند و این باید به طور کامل در RAM سیستم قبل از دسته بندی به GPU VRAM قرار گیردبه طور مشابه، تنظیم دقیق مدل زبان بزرگ با LoRA نیاز به نگهداری کل مجموعه داده های پیش پردازش شده در رم سیستم دارد، که برای یک کورپوس متن 50GB با هزینه های فوق العاده توکن سازی به راحتی می تواند از 64GB بیشتر باشد.سایر بارهای کاری هوش مصنوعی که نیاز به RAM دارند عبارتند از:: آموزش شبکه عصبی گراف که در آن ماتریس مجاوریت از VRAM بیشتر است، شمارش k-mer در لوله های ژنومیک ML،و جستجوی hyperparameter که در آن پیکربندی های آموزشی متعدد به صورت متوالی ارزیابی می شوند و مجموعه داده ها باید مستقر باشند..
سوال ۴: چرا این ماژول ۶۴ گیگابایتی از ۵۶۰۰ مگاهرتز به جای سرعت بالاتر مانند ۶۰۰۰ مگاهرتز استفاده می کند؟
A: در تراکم 64GB با استفاده از IC های دو رده 32Gb، بار الکتریکی بر روی کنترل کننده حافظه به طور قابل توجهی بالاتر از یک ماژول 16GB یا 32GB است. فرکانس های بالاتر نیاز به یکپارچگی سیگنال تمیزتر دارند.که با بارگذاری ظرفیت 16+ DRAM IC در یک DIMM واحد چالش برانگیز می شود. 5600MHz بالاترین فرکانس را نشان می دهد که ما می توانیم قابلیت اطمینان را در این تراکم در طیف گسترده ای از مادربرد های مصرف کننده بدون نیاز به تنظیم ولتاژ دستی تأیید کنیم.یک ماژول 64GB در 6000MHz از نظر فنی امکان پذیر است اما نیاز به بسته بندی IC سخت تر دارد، یک انباشت PCB گران تر و سازگاری محدود تر در مادربرد دارد که همه آنها باعث افزایش هزینه های قابل توجهی برای بهبود محدودی پهنای باند در دنیای واقعی می شود (44.8 GB / s در مقابل 48.0 GB / s).برای پیش پردازش داده های هوش مصنوعی که در آن پهنای باند خواندن دنباله ای مهم تر از تاخیر دسترسی تصادفی است، تفاوت بین 5600MHz و 6000MHz به طور معمول کمتر از 5٪ در خروجی است.
سوال 5: آیا خرید یک ماژول 64 گیگابایتی یا خرید دو ماژول 32 گیگابایتی برای عملیات دو کانال بهتر است؟
پاسخ: این بستگی به مسیر ارتقاء شما دارد. دو ماژول 32 گیگابایتی در دو کانال 89.6 گیگابایت / ثانیه پهنای باند ترکیبی در مقابل 44 فراهم می کند.8 گیگابایت در ثانیه از یک ماژول 64 گیگابایتی یک تفاوت قابل توجهی برای بار های کاری حساس به پهنای باندبا این حال، یک ماژول 64GB سه اسلات DIMM را برای گسترش آینده به 128GB، 192GB یا 256GB آزاد می کند. توصیه ما:اگر حجم کار شما عمدتاً به ظرفیت محدود است (برآورد مجموعه داده های بزرگ در RAM) و شما قصد دارید بعداً گسترش دهید، با یک ماژول 64GB شروع کنید. اگر بار کار شما به پهنای باند محدود است (نمونه های دسترسی تصادفی مکرر، چند رشته سنگین) و کل 64GB کافی است، دو ماژول 32GB را در دو کانال انتخاب کنید.پیکربندی ایده آل برای نمونه سازی هوش مصنوعی با حداکثر انعطاف پذیری دو ماژول 64GB (128GB دو کانال) است، که هم ظرفیت برای مجموعه داده های بزرگ و هم پهنای باند برای پردازش پیش از پردازش را فراهم می کند.