メインコンテンツまでスキップ

가상머신 진단 상태

가상머신 진단 상태가 비정상(Unhealthy) 또는 알 수 없음(Unknown) 으로 표시되면 아래 절차로 점검하세요. 상태 자체에 대한 설명은 컴퓨트 대시보드를 참고하세요.


알 수 없음(Unknown)

모니터링 시스템이 가상머신의 상태 정보를 정상적으로 수신하지 못하는 상태입니다.

1단계: 모니터링 에이전트 상태 확인

가상머신 내부의 eci-guest-agent가 정상 동작하는지 확인합니다.

sudo systemctl is-active eci-guest-agent.service
  • active 출력: 서비스 정상. 5분 후에도 상태가 바뀌지 않으면 2단계로 진행
  • inactive 또는 failed 출력: 아래 명령으로 재시작
sudo systemctl restart eci-guest-agent.service

재시작 후 is-active로 다시 확인합니다. 상세 로그는 sudo systemctl status eci-guest-agent.service 에서 확인할 수 있고, Active: active (running) 으로 표시되면 정상입니다.

2단계: 통신 연결 점검

에이전트는 정상이지만 'Unknown' 상태가 지속되면 호스트와의 통신을 직접 테스트합니다.

sudo systemctl stop eci-guest-agent.service
socat VSOCK-LISTEN:11190 STDOUT
테스트 후 반드시 서비스를 재시작하세요

테스트 전에 에이전트를 멈추지 않으면 Address already in use 오류가 발생합니다. 테스트가 끝나면 모니터링 재개를 위해 서비스를 다시 시작해야 합니다.

sudo systemctl start eci-guest-agent.service
  • 정상: 명령어 실행 후 커서가 대기 상태를 유지하며, 잠시 후 {"command": "cpu-metric", "args": null} 같은 요청이 수신됩니다.
  • 비정상: 실행 즉시 오류 메시지가 출력됩니다.

3단계: 지원 문의

위 절차로 해결되지 않으면 다음 정보를 첨부해 지원 채널로 문의하세요.

  • 서비스 로그: sudo journalctl -eu eci-guest-agent.service --no-pager | tail
  • 통신 테스트 오류 메시지 (해당하는 경우)

비정상(Unhealthy)

모니터링 시스템이 가상머신에 할당된 가속기(GPU·NPU)를 정상적으로 확인하지 못하거나, 가속기가 정상 작동하지 않는 상태입니다. 아래 단계를 순서대로 진행하되, 각 단계에서는 할당된 가속기 종류에 해당하는 항목만 확인하면 됩니다.

1단계: 가속기 하드웨어 인식 확인

가속기 종류에 맞는 명령으로 PCI 인식 여부를 확인합니다.

NVIDIA GPU

lspci | grep -i nvidia

Furiosa NPU (Warboy·Renegade)

lspci | grep -i furiosa

Rebellions NPU (ATOM Plus·Max)

lspci | grep -i rebellions

해당 디바이스가 출력되지 않으면 하드웨어 인식이 되지 않은 상태입니다.

2단계: 관리 도구 확인

가속기 메트릭은 각 벤더가 제공하는 관리 도구(nvidia-smi·rbln-smi·furiosa-smi 등 SMI 계열, 또는 furiosactl)로 수집합니다. 도구가 설치되어 있고 실행 경로에 있는지 확인합니다.

관리 도구를 임의로 삭제하거나 경로를 변경하지 마세요

nvidia-smi, furiosa-smi(또는 furiosactl), rbln-smi 등 각 가속기의 관리 도구는 메트릭 수집에도 사용됩니다. 삭제하거나 경로가 변경되어 실행이 안 되면 복구 전까지 해당 가속기의 메트릭 수집을 하지 못하고 진단 상태가 계속 비정상으로 유지됩니다.

NVIDIA GPU

command -v nvidia-smi

경로가 출력됨(예: /usr/bin/nvidia-smi)이면 정상입니다. 아무것도 출력되지 않으면 삭제되었거나 경로가 변경된 상태이므로, 의도된 것이 아니라면 GPU 드라이버 FAQ를 참고하여 복구하세요.

Furiosa NPU

command -v furiosa-smi furiosactl

최신 Furiosa SDK(Renegade 등)는 furiosa-smi를, Warboy 레거시 환경은 furiosactl을 사용합니다. 아무것도 출력되지 않으면 SDK가 설치되지 않았거나 경로가 변경된 상태이므로 Furiosa SDK를 재설치하세요.

Rebellions NPU

command -v rbln-smi

경로가 출력되지 않으면 RBLN 드라이버·SDK가 설치되지 않았거나 경로가 변경된 상태이므로 RBLN SDK를 재설치하세요.

3단계: 디바이스 상태·드라이버 확인

관리 도구는 있는데도 진단 상태가 비정상이면 디바이스 상태와 드라이버를 점검합니다.

NVIDIA GPU

GPU 인식·동작과 NVLink 패브릭 등록 상태를 확인합니다.

nvidia-smi --query-gpu=index,fabric.state,fabric.status --format=csv
  • 명령이 실행되지 않거나 오류가 발생하면 NVIDIA 드라이버·CUDA Toolkit 버전 호환성 문제입니다. CUDA initialize failed, nvidia-smi 실패, 드라이버/라이브러리 버전 불일치는 GPU 드라이버 FAQPyTorch CUDA 호환성 문제를 참고하세요.
  • NVLink(NVSwitch) 기반 GPU(H100·B200 등)는 fabric.state가 완료(Completed), fabric.status가 성공(Success)이어야 정상입니다. 그 외 값이면 패브릭 초기화 미완료 상태이므로 VM을 재부팅하여 재초기화하세요. (NVLink를 쓰지 않는 GPU는 N/A로 표시되어도 정상입니다.)

Furiosa NPU

할당된 NPU가 모두 나타나고 정상(alive) 상태인지 확인합니다.

furiosa-smi info --format=json # 레거시: furiosactl info --format=json

각 디바이스의 alive 값이 1이면 정상입니다. alive1이 아니거나 디바이스가 누락되면 Furiosa SDK 재설치 또는 VM 재부팅으로 복구하세요.

Rebellions NPU

할당된 NPU가 모두 나타나는지, 각 디바이스의 status·pstate 값을 확인합니다.

rbln-smi --query -qd npu,device,status,pstate
  • pstateP12로 표시되면 NPU가 시스템 중단(System Abort, Hang) 상태입니다. 실행 중인 워크로드를 종료한 뒤 VM을 재부팅하여 복구하세요.
  • 디바이스가 목록에 나타나지 않으면 RBLN 드라이버·SDK를 재설치하거나 VM을 재부팅하세요.

4단계: 지원 문의

위 절차로 해결되지 않으면 다음 정보를 첨부해 지원 채널로 문의하세요.

  • lspci 출력 (해당 가속기 필터링 결과)
  • 관리 도구 경로 확인 결과 및 실행 출력 (nvidia-smi / furiosa-smi·furiosactl / rbln-smi)
  • 발생한 오류 메시지 전문 (NVIDIA는 사용 중인 CUDA Toolkit 버전 포함)

다음 단계