범용 인공지능을 연구하는 고려대학교 AGI Lab
고려대학교 AGI Lab은 멀티모달 생성 모델, 인간 정렬 언어 모델링, 대규모 에이전트 학습, AI for Science의 네 가지 분야를 핵심 축으로 연구하고 있고, 모든 분야가 범용 인공지능(AGI) 구현을 공통 목표로 삼고 있습니다.
AI for Science 연구실의 김예린 연구원(석사과정)은 화학 분야의 문제 해결을 돕는 LLM 에이전트의 사후 학습(Post-training) 전략을 다룹니다. 그리고 김용진 연구원(석박사통합과정)은 이미지 이해와 생성을 동시에 수행하는 통합 멀티모달 LLM의 이미지 생성 성능을 강화 학습으로 높이는 연구를 수행하고 있습니다.
강화 학습 연구에 고성능 GPU가 필수적인 이유
AGI Lab 연구팀은 GRPO(Group Relative Policy Optimization, 그룹 상대 정책 최적화) 계열 알고리즘을 사용합니다. 강화 학습은 일반 딥러닝 모델 학습보다 GPU 자원 소모가 큽니다. 학습 과정에서 학습 샘플을 생성하는 롤아웃 모델, 생성된 결과를 채점하는 리워드 모델, 채점 결과를 바탕으로 모델을 업데이트하는 트레이너가 동시에 GPU 메모리에 적재되어 상호작용하기 때문입니다. 특히 학습 샘플 생성(추론) 단계에서 시간이 오래 걸리므로 개별 GPU의 성능이 연구 속도를 좌우합니다.
GRPO 강화 학습 연구의 GPU 자원 적재 구조

그동안 연구실 자체 서버만으로는 이 요구 사양을 감당하기 어려웠습니다. 모델의 수렴 여부를 관찰하기 위해 3,000단계까지 돌려야 하는 학습을 자원 부족으로 300단계에서 멈춰야 했던 한계가 있었습니다. 그렇다고 논문 마감을 앞두고 외부 GPU를 온디맨드 요금으로 빌려 쓰기에는 수천만 원에 달하는 임대 비용이 큰 장벽이었습니다.
최신 B200 장비를 합리적 비용에 사용할 수 있었던 엘리스클라우드 스팟 GPU
연구팀은 최신 B200 GPU를 확보하기 위해 엘리스클라우드 스팟 GPU를 선택했습니다. 자원이 회수될 수 있다는 조건을 감수하는 대신, 온디맨드보다 훨씬 저렴한 비용으로 최신 GPU 성능을 활용할 수 있었기 때문입니다. 다만 학습이 중간에 끊기면 안 되는 강화 학습의 특성상, 학습 도중 GPU가 회수되어 작업이 중단되지 않을까하며 처음에는 우려하기도 했습니다.
이 문제를 연구팀은 가중치 저장 주기를 짧게 설정해 문제를 해결했습니다. 중간에 회수되더라도 저장 시점부터 다시 이어서 학습을 재개하도록 워크플로우를 짰고, 또한 회수 전에 사전 알림을 주는 시스템 덕분에 안심하고 실험에 집중했습니다.
인프라를 쉽게 관리할 수 있는 ECI(Elice Cloud Infrastructure)도 유용했습니다. 사용 가이드가 직관적이어서 장비 세팅이 빨랐고, 메신저 기반의 문의 창구로 필요한 기술 지원을 실시간으로 받았습니다. 또한, 논문 제출이 다가와 자원 추가를 요청했을 때도 매니저들의 빠른 피드백 덕분에 마감 일정을 무사히 맞췄습니다.
비용 약 2배 절감, 학습 시간 절반 단축
정량적인 인프라 비용 절감 효과가 두드러졌습니다. B200 4대를 온디맨드로 2개월 임대할 때 드는 비용인 약 4,000만 원 기준에서, 스팟 GPU를 도입해 약 2,500만 원 선으로 지출을 낮췄습니다.
학습 속도도 크게 개선됐습니다. 기존 H100 8대 환경에서 3~4일씩 걸리던 학습 일정이 B200 4대로 1.5~2일 만에 끝났습니다. GPU 대수는 줄었지만 B200의 칩셋당 성능이 뛰어난 덕분에 연산 효율이 약 2배로 늘었습니다. 인프라 한계로 포기했던 3,000단계 학습을 완주하고 논문 제출 일정에 맞게 데이터를 완성했습니다.
주요 도입 성과 비교

"가장 먼저 강조하고 싶은 점은 최신 GPU에 대한 접근성입니다. 저희 같은 학생 연구자 입장에서는 B200 같은 최신 장비를 단독으로 확보하기가 현실적으로 쉽지 않은데, 엘리스클라우드 스팟 GPU를 통해 합리적인 비용으로 최신 장비를 바로 열어 쓸 수 있다는 점은 큰 장점이라고 생각합니다." — 고려대학교 AGI Lab 김예린 연구원
더 큰 스케일의 강화 학습 연구를 준비하는 AGI Lab
고려대학교 AGI Lab은 앞으로 파라미터 규모가 더 거대한 LLM을 대상으로 SFT(Supervised Fine-Tuning, 지도 미세 조정) 및 강화 학습의 사후 학습을 확대 진행할 예정입니다. 대규모 강화 학습처럼 자원 요구량이 기하급수적으로 늘어나는 연구에서 합리적인 최신 GPU 임대 방안은 필수적입니다. 연구팀은 자원의 벽에 막혀 도전하지 못했던 거대 스케일의 실험을 적극적으로 엘리스클라우드와 함께 수행할 계획입니다.
합리적인 고성능 GPU 인프라를 찾고 있다면 엘리스클라우드의 다른 도입 사례도 확인해 보세요.




