Центр Диагностики & База Системных Ошибок

Решения для Windows Server, Active Directory, 1С, СУБД, Linux, Cisco, MikroTik и IP-телефонии.

⚠️ Важная информация Все материалы, инструкции, команды и скрипты предоставлены исключительно в ознакомительных целях. Их применение может повлиять на работу операционной системы, баз данных и сетевого оборудования. Перед выполнением действий обязательно создайте резервную копию. При отсутствии необходимой квалификации обратитесь к ИТ-специалистам.
PCIe AER: error received Linux / DevOps

PCIe AER: Corrected / Uncorrected Error — Решение ошибок шины PCIe в Linux

Обновлено: 18.08.2026  ·  Официальная база знаний

Архитектура ошибки и симптомы сбоя

Сообщения «PCIe AER: Corrected / Uncorrected (Fatal/Non-Fatal) error received» генерируются драйвером расширенной отчетности об ошибках шины PCI Express (AER). Они указывают на сбои передачи пакетов TLP/DLLP на физическом, канальном или транзакционном уровне между процессором, чипсетом и периферийным устройством (NVMe-накопители, сетевые карты, GPU, HBA-адаптеры).

Диагностическая таблица параметров сбоя

ПараметрЗначениеИнженерный смысл сбоя
PCIe AERAdvanced Error ReportingСтандартный механизм детальной телеметрии ошибок шины PCIe.
Corrected ErrorReceiver Error / Bad TLPАппаратно перепосланный пакет (помехи на линиях связи, просадка питания).
Uncorrected FatalMalformed TLP / Completer AbortФатальный разрыв соединения с PCIe-устройством (устройство 'отвалилось' с шины).

Пошаговое дерево решений и сценарии траблшутинга

Сценарий 1: Локализация сбойного устройства по PCI BDF (Bus/Device/Function)

В строке ошибки найдите адрес устройства (например, 0000:01:00.0):

# Определение имени и модели устройства:
lspci -s 0000:01:00.0 -vvv

# Просмотр детального статуса AER устройства:
sudo lspci -s 0000:01:00.0 -vvv | grep -A 20 -i "Advanced Error Reporting"

Сценарий 2: Отключение энергосбережения шины PCIe (ASPM)

На многих серверах и NVMe накопителях ошибки AER вызываются некорректным выходом линий из энергосберегающего режима ASPM:

# Добавьте параметры в /etc/default/grub:
GRUB_CMDLINE_LINUX="pcie_aspm=off pci=noaer"

# Обновите загрузчик:
sudo update-grub  # Для Ubuntu/Debian
sudo grub2-mkconfig -o /boot/grub2/grub.cfg  # Для RHEL/CentOS

Сценарий 3: Аппаратная проверка райзеров (Riser Cards) и слотов

  • Переустановите PCIe-плату в другой физический слот.
  • Замените райзер-карту (PCIe Riser) в стоечном сервере.
  • Обновите прошивку (Firmware) проблемного NVMe-накопителя или сетевой карты.
Отваливаются NVMe диски или GPU под нагрузкой?
ITSTM проводит аудит аппаратной совместимости PCIe-устройств, обновление микропрограмм контроллеров и стабилизацию серверных платформ.
Практический опыт инженера: При установке потребительских SSD NVMe в корпоративные серверы всегда отключайте ASPM (pcie_aspm=off), так как десктопные контроллеры некорректно обрабатывают состояния L1/L1.1/L1.2 на серверных чипсетах.

Частые вопросы (FAQ)

Безопасно ли отключать AER с помощью pci=noaer?

Параметр pci=noaer лишь отключает спам сообщений в системный журнал dmesg, но не устраняет физическую проблему нестабильности шины. Его можно использовать как временную меру для предотвращения переполнения диска логами.

Почему ошибки AER чаще всего возникают на NVMe накопителях?

NVMe-накопители работают напрямую с линиями PCIe процессора на высоких частотах (Gen3/Gen4/Gen5). Любой перегрев контроллера накопителя или плохой контакт в разъеме M.2/U.2 вызывает ошибки целостности сигналов.