EDAC MC0: CE (Correctable Error) — Диагностика ECC памяти в Linux
Архитектура ошибки и симптомы сбоя
Сообщение «EDAC MC0: CE (Correctable Error) row memory error detected» регистрируется драйвером ядра EDAC (Error Detection and Correction) или службой rasdaemon. Это аппаратное предупреждение контроллера памяти (Memory Controller #0) о том, что в модуле ECC RAM произошла однобитовая ошибка (Single-Bit Flip), которая была успешно скорректирована аппаратно алгоритмом Хэмминга без сбоя ОС, но сигнализирует о физической деградации конкретной микросхемы памяти.
Диагностическая таблица параметров сбоя
| Параметр | Значение | Инженерный смысл сбоя |
|---|---|---|
| MC0 | Memory Controller 0 | Аппаратный контроллер памяти первого сокета CPU. |
| CE (Correctable Error) | Single-Bit Error | Аппаратно исправленная ошибка (система продолжает стабильную работу). |
| Channel / Slot / Row | DIMM Location | Физические координаты сбойного модуля памяти на материнской плате. |
Пошаговое дерево решений и сценарии траблшутинга
Сценарий 1: Локализация физического слота DIMM через rasdaemon
# Установка и запуск службы RAS-мониторинга:
sudo apt-get install rasdaemon || sudo dnf install rasdaemon
sudo systemctl enable --now rasdaemon
# Просмотр статистики ошибок по конкретным слотам:
sudo ras-mc-ctl --error-count
sudo ras-mc-ctl --summaryСценарий 2: Сверка координат с IPMI/iDRAC/iLO
Получите журнал системных событий аппаратного контроллера управления сервером:
# Чтение логов SEL (System Event Log):
sudo ipmitool sel elist | grep -i "memory"
# Пример вывода: 'Correctable ECC logging limit reached for DIMM_A1'Сценарий 3: Превентивная замена и чистка контактных площадок
- Идентифицируйте планку (например, CPU1_DIMM_A1).
- В плановое окно обслуживания отключите сервер, извлеките модуль RAM, очистите контакты изопропиловым спиртом и поменяйте местами с соседним заведомо исправным слотом.
- Если ошибки продолжают накапливаться по тому же модулю — замените планку RAM.
ITSTM проводит предиктивную аппаратную диагностику серверов (HP, Dell, Supermicro, Huawei) и оперативную замену компонентов с сохранением гарантии.
Частые вопросы (FAQ)
Опасны ли единичные ошибки CE (Correctable Error)?
Единичные ошибки, возникающие раз в несколько месяцев из-за космической радиации, допустимы. Однако лавинообразный рост счетчика (сотни ошибок в час на одной планке) гарантированно приведет к фатальной некорректируемой ошибке (UE) и падению сервера.
Чем rasdaemon лучше старого модуля edac-utils?
rasdaemon использует tracepoints ядра и собирает детальные данные не только по памяти, но и по ошибкам шины PCIe (AER), MCE процессора и дискового ввода-вывода в единую базу SQLite.