| Предыдущий | Следующий |
| MACHINE_CHECK_EXCEPTION | DRIVER_POWER_STATE_FAILURE |
USER_MODE_HEALTH_MONITOR
Что означает USER_MODE_HEALTH_MONITOR
USER_MODE_HEALTH_MONITOR — bugcheck, который используется, когда критически важный компонент пользовательского режима не проходит контроль работоспособности и система не может безопасно продолжать работу обычным способом. Это уже системная остановка, а не только диагностический live dump.
Параметры
| Параметр | Что содержит |
|---|---|
| 1 | Процесс, который не прошёл проверку работоспособности за установленный интервал. |
| 2 | Интервал watchdog в секундах. |
| 3 | Источник watchdog, помогающий определить компонент, инициировавший контроль. |
| 4 | Зарезервировано. |
Основные источники watchdog
WatchdogSourceRhsCleanup— контролируется завершение Resource Hosting Subsystem при штатном выходе.WatchdogSourceRhsResourceDeadlock*иWatchdogSourceRhsResourceTypeDeadlock*— RHS завершает работу из-за deadlock конкретного ресурса или типа ресурса.WatchdogSourceRhsExceptionFromResourceиWatchdogSourceRhsUnhandledException— RHS завершает работу после необработанного исключения.WatchdogSourceClussvcUnhandledException— необработанное исключение в Cluster Service.WatchdogSourceClussvcIsAlive— Cluster Service перестал вовремя передавать heartbeat в netft; среди причин возможны CPU starvation или длительная блокировка.- Специализированные значения для Physical Disk, Storage Pool, File Server, Storage Replica, Storage QoS и NFS уточняют, какой кластерный ресурс участвовал в deadlock.
Как диагностировать
Начните с процесса из параметра 1 и конкретного WatchdogSource* из параметра 3. Для RHS исследуйте поток ресурса, который не завершил операцию, held locks и callback ресурса; для Cluster Service проверьте heartbeat, загрузку CPU и потоки службы.
Затем сопоставьте bugcheck с Failover Clustering и System events непосредственно перед остановкой. Отдельно ищите признаки deadlock, нехватки памяти, чрезмерной конкуренции за блокировки и ситуации, когда критический процесс долго не получает CPU.
Восстановление
Перезапуск узла может вернуть службу в работу, но не является доказательством исправления. Для повторяющегося случая нужно устранить зависающий ресурс, драйвер/службу, создающую блокировку, либо причину starvation. Если перед bugcheck создавался USER_MODE_HEALTH_MONITOR_LIVEDUMP, сравните его стек с финальным дампом: это помогает увидеть, что изменилось между первым срабатыванием watchdog и остановкой системы.
Технические ссылки
Нужно найти другой код? Найти другой код состояния или ошибки.