가상머신 진단 상태
가상머신 진단 상태가 비정상(Unhealthy) 또는 알 수 없음(Unknown) 으로 표시되면 아래 절차로 점검하세요. 상태 자체에 대한 설명은 컴퓨트 대시보드를 참고하세요.
알 수 없음(Unknown)
모니터링 시스템이 가상머신의 상태 정보를 정상적으로 수신하지 못하는 상태입니다.
1단계: 모니터링 에이전트 상태 확인
가상머신 내부의 eci-guest-agent가 정상 동작하는지 확인합니다.
sudo systemctl is-active eci-guest-agent.service
active출력: 서비스 정상. 5분 후에도 상태가 바뀌지 않으면 2단계로 진행inactive또는failed출력: 아래 명령으로 재시작
sudo systemctl restart eci-guest-agent.service
재시작 후 is-active로 다시 확인합니다. 상세 로그는 sudo systemctl status eci-guest-agent.service 에서 확인할 수 있고, Active: active (running) 으로 표시되면 정상입니다.
2단계: 통신 연결 점검
에이전트는 정상이지만 'Unknown' 상태가 지속되면 호스트와의 통신을 직접 테스트합니다.
sudo systemctl stop eci-guest-agent.service
socat VSOCK-LISTEN:11190 STDOUT
테스트 전에 에이전트를 멈추지 않으면 Address already in use 오류가 발생합니다. 테스트가 끝나면 모니터링 재개를 위해 서비스를 다시 시작해야 합니다.
sudo systemctl start eci-guest-agent.service
- 정상: 명령어 실행 후 커서가 대기 상태를 유지하며, 잠시 후
{"command": "cpu-metric", "args": null}같은 요청이 수신됩니다. - 비정상: 실행 즉시 오류 메시지가 출력됩니다.
3단계: 지원 문의
위 절차로 해결되지 않으면 다음 정보를 첨부해 지원 채널로 문의하세요.
- 서비스 로그:
sudo journalctl -eu eci-guest-agent.service --no-pager | tail - 통신 테스트 오류 메시지 (해당하는 경우)
비정상(Unhealthy)
모니터링 시스템이 가상머신에 할당된 가속기(GPU·NPU)를 정상적으로 확인하지 못하거나, 가속기가 정상 작동하지 않는 상태입니다. 아래 단계를 순서대로 진행하되, 각 단계에서는 할당된 가속기 종류에 해당하는 항목만 확인하면 됩니다.
1단계: 가속기 하드웨어 인식 확인
가속기 종류에 맞는 명령으로 PCI 인식 여부를 확인합니다.
NVIDIA GPU
lspci | grep -i nvidia
Furiosa NPU (Warboy·Renegade)
lspci | grep -i furiosa
Rebellions NPU (ATOM Plus·Max)
lspci | grep -i rebellions
해당 디바이스가 출력되지 않으면 하드웨어 인식이 되지 않은 상태입니다.
2단계: 관리 도구 확인
가속기 메트릭은 각 벤더가 제공하는 관리 도구(nvidia-smi·rbln-smi·furiosa-smi 등 SMI 계열, 또는 furiosactl)로 수집합니다. 도구가 설치되어 있고 실행 경로에 있는지 확인합니다.
nvidia-smi, furiosa-smi(또는 furiosactl), rbln-smi 등 각 가속기의 관리 도구는 메트릭 수집에도 사용됩니다. 삭제하거나 경로가 변경되어 실행이 안 되면 복구 전까지 해당 가속기의 메트릭 수집을 하지 못하고 진단 상태가 계속 비정상으로 유지됩니다.
NVIDIA GPU
command -v nvidia-smi
경로가 출력됨(예: /usr/bin/nvidia-smi)이면 정상입니다. 아무것도 출력되지 않으면 삭제되었거나 경로가 변경된 상태이므로, 의도된 것이 아니라면 GPU 드라이버 FAQ를 참고하여 복구하세요.
Furiosa NPU
command -v furiosa-smi furiosactl
최신 Furiosa SDK(Renegade 등)는 furiosa-smi를, Warboy 레거시 환경은 furiosactl을 사용합니다. 아무것도 출력되지 않으면 SDK가 설치되지 않았거나 경로가 변경된 상태이므로 Furiosa SDK를 재설치하세요.
Rebellions NPU
command -v rbln-smi
경로가 출력되지 않으면 RBLN 드라이버·SDK가 설치되지 않았거나 경로가 변경된 상태이므로 RBLN SDK를 재설치하세요.
3단계: 디바이스 상태·드라이버 확인
관리 도구는 있는데도 진단 상태가 비정상이면 디바이스 상태와 드라이버를 점검합니다.
NVIDIA GPU
GPU 인식·동작과 NVLink 패브릭 등록 상태를 확인합니다.
nvidia-smi --query-gpu=index,fabric.state,fabric.status --format=csv
- 명령이 실행되지 않거나 오류가 발생하면 NVIDIA 드라이버·CUDA Toolkit 버전 호환성 문제입니다.
CUDA initialize failed,nvidia-smi실패, 드라이버/라이브러리 버전 불일치는 GPU 드라이버 FAQ와 PyTorch CUDA 호환성 문제를 참고하세요. - NVLink(NVSwitch) 기반 GPU(H100·B200 등)는
fabric.state가 완료(Completed),fabric.status가 성공(Success)이어야 정상입니다. 그 외 값이면 패브릭 초기화 미완료 상태이므로 VM을 재부팅하여 재초기화하세요. (NVLink를 쓰지 않는 GPU는N/A