가상머신 진단 상태
가상머신 진단 상태가 비정상(Unhealthy) 또는 알 수 없음(Unknown) 으로 표시되면 아래 절차로 점검하세요. 상태 자체에 대한 설명은 컴퓨트 대시보드를 참고하세요.
알 수 없음(Unknown)
모니터링 시스템이 가상머신의 상태 정보를 정상적으로 수신하지 못하는 상태입니다.
1단계: 모니터링 에이전트 상태 확인
가상머신 내부의 eci-guest-agent가 정상 동작하는지 확인합니다.
sudo systemctl is-active eci-guest-agent.service
active출력: 서비스 정상. 5분 후에도 상태가 바뀌지 않으면 2단계로 진행inactive또는failed출력: 아래 명령으로 재시작
sudo systemctl restart eci-guest-agent.service
재시작 후 is-active로 다시 확인합니다. 상세 로그는 sudo systemctl status eci-guest-agent.service 에서 확인할 수 있고, Active: active (running) 으로 표시되면 정상입니다.
2단계: 통신 연결 점검
에이전트는 정상이지만 'Unknown' 상태가 지속되면 호스트와의 통신을 직접 테스트합니다.
sudo systemctl stop eci-guest-agent.service
socat VSOCK-LISTEN:11190 STDOUT
테스트 전에 에이전트를 멈추지 않으면 Address already in use 오류가 발생합니다. 테스트가 끝나면 모니터링 재개를 위해 서비스를 다시 시작해야 합니다.
sudo systemctl start eci-guest-agent.service
- 정상: 명령어 실행 후 커서가 대기 상태를 유지하며, 잠시 후
{"command": "cpu-metric", "args": null}같은 요청이 수신됩니다. - 비정상: 실행 즉시 오류 메시지가 출력됩니다.
3단계: 지원 문의
위 절차로 해결되지 않으면 다음 정보를 첨부해 지원 채널로 문의하세요.
- 서비스 로그:
sudo journalctl -eu eci-guest-agent.service --no-pager | tail - 통신 테스트 오류 메시지 (해당하는 경우)
비정상(Unhealthy)
모니터링 시스템이 가상머신에 할당된 가속기(GPU·NPU)를 정상적으로 확인하지 못하거나, 가속기가 정상 작동하지 않는 상태입니다. 아래 단계를 순서대로 진행하되, 각 단계에서는 할당된 가속기 종류에 해당하는 항목만 확인하면 됩니다.
1단계: 가속기 하드웨어 인식 확인
가속기 종류에 맞는 명령으로 PCI 인식 여부를 확인합니다.
NVIDIA GPU
lspci | grep -i nvidia
Furiosa NPU (Warboy·Renegade)
lspci | grep -i furiosa
Rebellions NPU (ATOM Plus·Max)
lspci | grep -i rebellions
해당 디바이스가 출력되지 않으면 하드웨어 인식이 되지 않은 상태입니다.
2단계: 관리 도구 확인
가속기 메트릭은 각 벤더가 제공하는 관리 도구(nvidia-smi·rbln-smi·furiosa-smi 등 SMI 계열, 또는 furiosactl)로 수집합니다. 도구가 설치되어 있고 실행 경로에 있는지 확인합니다.
nvidia-smi, furiosa-smi(또는 furiosactl), rbln-smi 등 각 가속기의 관리 도구는 메트릭 수집에도 사용됩니다. 삭제하거나 경로가 변경되어 실행이 안 되면 복구 전까지 해당 가속기의 메트릭 수집을 하지 못하고 진단 상태가 계속 비정상으로 유지됩니다.
NVIDIA GPU
command -v nvidia-smi
경로가 출력됨(예: /usr/bin/nvidia-smi)이면 정상입니다. 아무것도 출력되지 않으면 삭제되었거나 경로가 변경된 상태이므로, 의도된 것이 아니라면 GPU 드라이 버 FAQ를 참고하여 복구하세요.
Furiosa NPU
command -v furiosa-smi furiosactl
최신 Furiosa SDK(Renegade 등)는 furiosa-smi를, Warboy 레거시 환경은 furiosactl을 사용합니다. 아무것도 출력되지 않으면 SDK가 설치되지 않았거나 경로가 변경된 상태이므로 Furiosa SDK를 재설치하세요.
Rebellions NPU
command -v rbln-smi
경로가 출력되지 않으면 RBLN 드라이버·SDK가 설치되지 않았거나 경로가 변경된 상태이므로 RBLN SDK를 재설치하세요.
3단계: 디바이스 상태·드라이버 확인
관리 도구는 있는데도 진단 상태가 비정상이면 디바이스 상태와 드라이버를 점검합니다.
NVIDIA GPU
GPU 인식·동작과 NVLink 패브릭 등록 상태를 확인합니다.
nvidia-smi --query-gpu=index,fabric.state,fabric.status --format=csv
- 명령이 실행되지 않거나 오류가 발생하면 NVIDIA 드라이버·CUDA Toolkit 버전 호환성 문제입니다.
CUDA initialize failed,nvidia-smi실패, 드라이버/라이브러리 버전 불일치는 GPU 드라이버 FAQ와 PyTorch CUDA 호환성 문제를 참고하세요. - NVLink(NVSwitch) 기반 GPU(H100·B200 등)는
fabric.state가 완료(Completed),fabric.status가 성공(Success)이어야 정상입니다. 그 외 값이면 패브릭 초기화 미완료 상태이므로 VM을 재부팅하여 재초기화하세요. (NVLink를 쓰지 않는 GPU는N/A로 표시되어도 정상입니다.)
Furiosa NPU
할당된 NPU가 모두 나타나고 정상(alive) 상태인지 확인합니다.
furiosa-smi info --format=json # 레거시: furiosactl info --format=json
각 디바이스의 alive 값이 1이면 정상입니다. alive가 1이 아니거나 디바이스가 누락되면 Furiosa SDK 재설치 또는 VM 재부팅으로 복구하세요.
Rebellions NPU
할당된 NPU가 모두 나타나는지, 각 디바이스의 status·pstate 값을 확인합니다.
rbln-smi --query -qd npu,device,status,pstate
pstate가 P12로 표시되면 NPU가 시스템 중단(System Abort, Hang) 상태입니다. 실행 중인 워크로드를 종료한 뒤 VM을 재부팅하여 복구하세요.- 디바이스가 목록에 나타나지 않으면 RBLN 드라이버·SDK를 재설치하거나 VM을 재부팅하세요.
4단계: 지원 문의
위 절차로 해결되지 않으면 다음 정보를 첨부해 지원 채널로 문의하세요.
lspci출력 (해당 가속기 필터링 결과)- 관리 도구 경로 확인 결과 및 실행 출력 (
nvidia-smi/furiosa-smi·furiosactl/rbln-smi) - 발생한 오류 메시지 전문 (NVIDIA는 사용 중인 CUDA Toolkit 버전 포함)
다음 단계
- 컴퓨트 대시보드: 비정상 가상머신 일괄 모니터링
- GPU 드라이버 FAQ:
nvidia-smi실패, 드라이버/라이브러리 버전 mismatch - PyTorch CUDA 호환성 문제: PyTorch에서 CUDA 미인식