Центр Диагностики & База Системных Ошибок

Решения для Windows Server, Active Directory, 1С, СУБД, Linux, Cisco, MikroTik и IP-телефонии.

⚠️ Важная информация Все материалы, инструкции, команды и скрипты предоставлены исключительно в ознакомительных целях. Их применение может повлиять на работу операционной системы, баз данных и сетевого оборудования. Перед выполнением действий обязательно создайте резервную копию. При отсутствии необходимой квалификации обратитесь к ИТ-специалистам.
EDAC MC0: CE (Correctable Error) Linux / DevOps

EDAC MC0: CE (Correctable Error) — Диагностика ECC памяти в Linux

Обновлено: 18.08.2026  ·  Официальная база знаний

Архитектура ошибки и симптомы сбоя

Сообщение «EDAC MC0: CE (Correctable Error) row memory error detected» регистрируется драйвером ядра EDAC (Error Detection and Correction) или службой rasdaemon. Это аппаратное предупреждение контроллера памяти (Memory Controller #0) о том, что в модуле ECC RAM произошла однобитовая ошибка (Single-Bit Flip), которая была успешно скорректирована аппаратно алгоритмом Хэмминга без сбоя ОС, но сигнализирует о физической деградации конкретной микросхемы памяти.

Диагностическая таблица параметров сбоя

ПараметрЗначениеИнженерный смысл сбоя
MC0Memory Controller 0Аппаратный контроллер памяти первого сокета CPU.
CE (Correctable Error)Single-Bit ErrorАппаратно исправленная ошибка (система продолжает стабильную работу).
Channel / Slot / RowDIMM LocationФизические координаты сбойного модуля памяти на материнской плате.

Пошаговое дерево решений и сценарии траблшутинга

Сценарий 1: Локализация физического слота DIMM через rasdaemon

# Установка и запуск службы RAS-мониторинга:
sudo apt-get install rasdaemon || sudo dnf install rasdaemon
sudo systemctl enable --now rasdaemon

# Просмотр статистики ошибок по конкретным слотам:
sudo ras-mc-ctl --error-count
sudo ras-mc-ctl --summary

Сценарий 2: Сверка координат с IPMI/iDRAC/iLO

Получите журнал системных событий аппаратного контроллера управления сервером:

# Чтение логов SEL (System Event Log):
sudo ipmitool sel elist | grep -i "memory"

# Пример вывода: 'Correctable ECC logging limit reached for DIMM_A1'

Сценарий 3: Превентивная замена и чистка контактных площадок

  1. Идентифицируйте планку (например, CPU1_DIMM_A1).
  2. В плановое окно обслуживания отключите сервер, извлеките модуль RAM, очистите контакты изопропиловым спиртом и поменяйте местами с соседним заведомо исправным слотом.
  3. Если ошибки продолжают накапливаться по тому же модулю — замените планку RAM.
Растут счетчики ошибок ECC на сервере?
ITSTM проводит предиктивную аппаратную диагностику серверов (HP, Dell, Supermicro, Huawei) и оперативную замену компонентов с сохранением гарантии.
Практический опыт инженера: Настройте отправку алертов в Zabbix/Prometheus при превышении порога в 10 ошибок CE за 24 часа. Это позволяет заменить модуль памяти до того, как база данных упадет в аварийный shutdown.

Частые вопросы (FAQ)

Опасны ли единичные ошибки CE (Correctable Error)?

Единичные ошибки, возникающие раз в несколько месяцев из-за космической радиации, допустимы. Однако лавинообразный рост счетчика (сотни ошибок в час на одной планке) гарантированно приведет к фатальной некорректируемой ошибке (UE) и падению сервера.

Чем rasdaemon лучше старого модуля edac-utils?

rasdaemon использует tracepoints ядра и собирает детальные данные не только по памяти, но и по ошибкам шины PCIe (AER), MCE процессора и дискового ввода-вывода в единую базу SQLite.