Dla administratorów systemu:XRISS DDR4 32GB 2666MHz RDIMM ECC jest modułem wymiany i rozbudowy dla zarejestrowanego DDR4 ekosystemu pamięci serwerowej ECC.Poniżej znajdują się procedury weryfikacji i monitorowania, które zalecamy do wdrożenia w przedsiębiorstwie.
Ten RDIMM wykorzystuje x4-organizowane układy DRAM IC z pełnym 72-bitowym ECC (64 danych + 8 ECC).umożliwiający pełną prędkość pracy przy wypełnieniu wszystkich kanałów pamięci. Każdy moduł przed wysyłką przechodzi 72-godzinny proces spalania w temperaturze 55°C przy ciągłym testowaniu wtryskiwania błędów ECC,zapewnienie nie tylko niezawodności układów centralnych DRAM, ale także układu rejestrowego i powiązanych ścieżek sygnału w trwałych warunkach termicznych centrum danych.
W przypadku klastrów VMware vSphere moduł ten został zweryfikowany w konfiguracjach vSAN w pełnym flashie, gdzie błędy pamięci mogą uszkodzić poziom pamięci podręcznej vSAN.ochrona ECC zapewnia, że obliczenia sumy kontrolnej w pamięci podręcznej ARC są sprawdzalnie poprawne. W przypadku serwerów bazy danych o prostym metalu z PostgreSQL lub MySQL z dużymi pulami buforów,ECC zapobiega scenariuszowi cichego uszkodzenia danych, w którym błąd pojedynczego bita w puli buforu rozprzestrzenia się na dysku podczas następnego punktu kontrolnego.
P1. Jak monitorować wskaźniki błędu ECC na uruchamianym serwerze Linux, aby wykryć problemy z pamięcią, zanim spowodują przestoj?
A: Zainstaluj i skonfiguruj rasdaemon (RAS - Rzetelność, Dostępność, Serwisowalność daemon), który jest dostępny w repozytoriach wszystkich głównych dystrybucji Linux.`ras-mc-ctl --summary` wyświetla liczbę poprawnych i niepoprawnych błędów na DIMMJeden poprawny błąd w miesiącu jest normalny i oczekiwany z powodu promieniowania tła.tendencja wzrostowa z 1 błędu/miesiąc do 1 błędu/tydzień do 1 błędu/dzień wskazuje na pogarszającą się komórkę DRAM, a moduł powinien zostać proaktywnie wymieniony. Większość serwerów BMC (iDRAC, iLO, XClarity) śledzi również błędy pamięci i może być skonfigurowana do wysyłania pułapek SNMP lub powiadomień e-mail, gdy poprawialne wskaźniki błędów przekraczają konfigurowalne progi.Dla VMware ESXi, monitorowanie stanu sprzętu vCenter zapewnia równoważną funkcjonalność za pośrednictwem dostawcy CIM.
Czy ten RDIMM może być używany w konsumpcyjnej płycie stacjonarnej obsługującej ECC (jak niektóre płyty ASRock lub ASUS)?
Odpowiedź: Nie. RDIMM (Registered DIMM) są elektrycznie niezgodne z komputerami stacjonarnymi.Zarejestrowany układ buforowy na moduł wymaga specjalnego wsparcia z kontrolera pamięci i BIOS, który jest dostępny tylko na platformach serwerów i stacji roboczych (Intel Xeon E5/E7/Scalable, AMD EPYC i niektóre serii Intel Xeon E-2300 z zestawem procesorów C256).Domyślne płyty główne, które reklamują wsparcie ECC (zwykle AMD AM4/AM5 z procesorami Ryzen niebędącymi APU) wymagają ECC UDIMM (Unbuffered DIMM z ECC)Nasz produkt ECC UDIMM (55610999) jest prawidłowym modułem dla tych platform.ale system po prostu nie uruchomi.
P3: Jaka jest różnica między organizacją DRAM x4 i x8 dla pamięci serwerowej i dlaczego ma to znaczenie?
A: organizacja x4 oznacza, że każdy chip DRAM przyczynia się do 4 bitów do każdego słowa danych, wymagając 18 chipów dla 72-bitowego słowa ECC (64 danych + 8 ECC). Organizacja x8 wykorzystuje 8 bitów na chip, wymagając tylko 9 chipów.Organizacja x4 jest standardem dla pamięci serwera przedsiębiorstwa, ponieważ zapewnia lepszą odporność na awarie układów: jeśli jeden chip x4 całkowicie nie działa, wpływa to tylko na 4 bity danych, a silnik ECC może teoretycznie to skorygować (zdolność "chipkill" lub SDDC).który przekracza 8-bitową możliwość korekty ECC i powoduje niepoprawny błądModuł ten wykorzystuje x4-organizowane układy DRAM IC, dlatego jest odpowiedni do wdrożeń serwerów o krytycznej misji, w których wymagana jest odporność na awarie pojedynczego układu.
Czy to oznacza, że ECC w rzeczywistości nic nie robi?
Odpowiedź: Nie, oznacza to, że ECC działa idealnie i w milczeniu koryguje błędy, o których nigdy nie musisz wiedzieć.system na poziomie morza z 256 GB DDR4 doświadcza około 0.5-2 błędy, które można poprawić średnio dziennie.(1) Monitoring nie jest skonfigurowany do zgłaszania błędów, które można skorygować (kontroluj konfigurację rasdaemon), (2) serwer znajduje się w środowisku o niskim promieniowaniu tła (pod ziemią centrum danych, ołowiane obudowa), (3) konkretna partia pamięci DRAM ma lepsze niż średnie właściwości błędów,lub (4) błędy są po prostu poniżej progu sprawozdawczego określonego przez Państwa system monitorowaniaBrak zgłoszonych błędów nie jest dowodem na to, że ECC jest niepotrzebny, ale na to, że system działa prawidłowo.Pierwszy raz widzisz niepoprawny błąd, który wykrywa ECC (zapobieganie cichej korupcji danych, które mogą spowodować awarię bazy danych lub systemu plików) jest, gdy wartość ECC staje się namacalnie widoczne.
Czy mogę użyć tego modułu do rozszerzenia pamięci w serwerze Dell PowerEdge, który obecnie używa pamięci certyfikowanej przez Dell?
Odpowiedź: Tak, połączenie XRISS RDIMM z pamięcią certyfikowaną przez Dell jest obsługiwane, chociaż dla optymalnej wydajności zalecamy przestrzeganie wytycznych populacji serwera dla zrównoważonych konfiguracji.Kluczowe aspekty1) dopasować prędkość: jeżeli istniejąca pamięć wynosi 2666 MHz, moduł ten będzie działał w częstotliwości 2666 MHz; jeżeli istniejąca pamięć wynosi 2400 MHz, wszystkie moduły będą działać w częstotliwości 2400 MHz;(2) Zastosowanie organizacji rzędowej (jednorzędowa vs.. podwójne ranking), gdy to możliwe, ponieważ zmieszanie rankingów może mieć wpływ na przepływ pamięci;(3) Serwery Dell PowerEdge mogą rejestrować zdarzenie "odkryte w pamięci niecertyfikowanej przez firmę Dell" w dzienniku kontrolera cyklu życia.Polityka gwarancyjna firmy Dell nie wymaga użycia pamięci certyfikowanej przez firmę Dell.