Что означает код BSOD 0x9E (USER_MODE_HEALTH_MONITOR)?

 
Также может означать:
КонстантаТипОС
ERROR_NOT_LOCKEDОшибка WindowsWindows
Предыдущий Следующий
MACHINE_CHECK_EXCEPTION DRIVER_POWER_STATE_FAILURE

USER_MODE_HEALTH_MONITOR

Что означает USER_MODE_HEALTH_MONITOR

USER_MODE_HEALTH_MONITOR — bugcheck, который используется, когда критически важный компонент пользовательского режима не проходит контроль работоспособности и система не может безопасно продолжать работу обычным способом. Это уже системная остановка, а не только диагностический live dump.

Параметры

ПараметрЧто содержит
1Процесс, который не прошёл проверку работоспособности за установленный интервал.
2Интервал watchdog в секундах.
3Источник watchdog, помогающий определить компонент, инициировавший контроль.
4Зарезервировано.

Основные источники watchdog

  • WatchdogSourceRhsCleanup — контролируется завершение Resource Hosting Subsystem при штатном выходе.
  • WatchdogSourceRhsResourceDeadlock* и WatchdogSourceRhsResourceTypeDeadlock* — RHS завершает работу из-за deadlock конкретного ресурса или типа ресурса.
  • WatchdogSourceRhsExceptionFromResource и WatchdogSourceRhsUnhandledException — RHS завершает работу после необработанного исключения.
  • WatchdogSourceClussvcUnhandledException — необработанное исключение в Cluster Service.
  • WatchdogSourceClussvcIsAlive — Cluster Service перестал вовремя передавать heartbeat в netft; среди причин возможны CPU starvation или длительная блокировка.
  • Специализированные значения для Physical Disk, Storage Pool, File Server, Storage Replica, Storage QoS и NFS уточняют, какой кластерный ресурс участвовал в deadlock.

Как диагностировать

Начните с процесса из параметра 1 и конкретного WatchdogSource* из параметра 3. Для RHS исследуйте поток ресурса, который не завершил операцию, held locks и callback ресурса; для Cluster Service проверьте heartbeat, загрузку CPU и потоки службы.

Затем сопоставьте bugcheck с Failover Clustering и System events непосредственно перед остановкой. Отдельно ищите признаки deadlock, нехватки памяти, чрезмерной конкуренции за блокировки и ситуации, когда критический процесс долго не получает CPU.

Восстановление

Перезапуск узла может вернуть службу в работу, но не является доказательством исправления. Для повторяющегося случая нужно устранить зависающий ресурс, драйвер/службу, создающую блокировку, либо причину starvation. Если перед bugcheck создавался USER_MODE_HEALTH_MONITOR_LIVEDUMP, сравните его стек с финальным дампом: это помогает увидеть, что изменилось между первым срабатыванием watchdog и остановкой системы.

Технические ссылки


Нужно найти другой код? Найти другой код состояния или ошибки.