전기 때문에 GPU 서버가 다섯 번 꺼졌습니다
: 누리미디어 인프라 담당자의 GPU 서버 구축기 (2) 고장과 전기 편
제목없음
제목없음
안녕하세요, 저는 누리미디어 개발운영팀에서 사내 서버와 네트워크를 담당하고 있습니다.
1편에서는 서버실이라는 공간 자체를 만들어가는 과정, 그러니까 열과 소음, 그리고 두 차례에 걸친 냉각 장치의 오작동과 씨름했던 이야기를 전해드렸습니다.
이렇게 공간 문제를 어느 정도 매듭짓고 나서는 하드웨어 고장이 이어졌습니다. 대부분 전기와 관련된 이슈였습니다.
이번 2편에서는 GPU 12장 체제가 완성되기까지 겪은 하드웨어 고장과 전력 싸움을 이야기하겠습니다.
제목없음
하드웨어는 생각보다 잘 고장 난다
10월 6일 새벽, GPU 4장을 모두 가동하던 서버가 갑자기 재부팅되더니 아예 부팅되지 않았습니다. 하필 추석 당일이었죠.
원인은 GPU 카드 한 장의 하드웨어 불량이었습니다.
교체용 GPU 카드를 구하는 것부터 쉽지 않았지만 새벽 내내 서버실에서 대응한 끝에 유지보수 업체로부터 카드를 교체받아 조치를 마쳤습니다.
이게 처음 겪은 하드웨어 고장도 아니었어요.
앞서 2025년 9월 17일 오전 9시에는 갑자기 서버 접속 자체가 안 됐습니다.
원격 콘솔엔 하드디스크 이상 메시지가 떠 있고 운영체제 로그인도 안 됐습니다.
가장 먼저 걱정한 건 역시 데이터였습니다.
강제 종료 후 10분 뒤 다시 켜자 다행히 정상 복구됐고 데이터 유실도 없었습니다.
원인은 디스크 캐시를 보호하는 배터리 고장이었습니다.
같은 날 오후 제조사 엔지니어가 방문해 배터리를 교체하면서 마무리됐습니다.
제목없음
두 번째 GPU 서버, H200을 들이다
H200 서버 도입 당일
H200
AI 서비스 규모가 커지면서 L40S 4장만으로는 처리해야 할 데이터와 모델 양을 감당하기 어려워졌습니다.
2025년 11월, 두 번째 GPU 서버 도입을 검토했고 이번엔 H200 4장을 선택했습니다.
H100이 단종되고 후속 모델인 H200 가격이 내려온 데다, NVLink를 활용하면 GPU 간 데이터 전송 속도를 약 7배까지 높일 수 있다는 점도 컸습니다.
두 서버의 역할도 나눴습니다.
H200은 장시간 고부하 학습과 대량 배치 작업을 맡고 기존 L40S는 소규모 실험과 검증, 신규 논문 OCR을 담당하기로 했습니다.
한 서버에 문제가 생겨도 모든 작업이 함께 멈추지 않게 하려고요.
앞선 몇 달간 장애를 겪으며 얻은 경험을 이 설계에 그대로 넣었습니다.
2026년 2월 24일, H200 서버가 들어왔지만 설치부터 순탄하지 않았습니다.
랙에 서버를 고정할 레일이 누락돼 임시로 철판 위에 올려 설치해야 했습니다. NVLink를 장착했는데도 인식이 안 됐고요.
살펴보니 부품이 아주 미세하게 떠 있었고 다시 눌렀더니 정상적으로 인식됐습니다.
4월에는 H200 서버가 갑자기 다운되는 일도 있었습니다.
하드웨어 로그에도 뚜렷한 오류가 없었고 전력도 정상이었는데, 분석 끝에 유력한 원인으로 지목된 건 펌웨어였습니다.
유지보수 업체에서는 "이 정도 최신 장비는 안정화까지 넉넉잡아 1년 정도는 걸린다"고 했어요.
클라우드를 쓸 땐 이런 일이 안 보였던 이유도 이때 알았습니다. 클라우드 사업자가 보이지 않는 곳에서 이런 작업을 대신 해주고 있었으니까요.
이후에는 주요 펌웨어 업데이트 공지를 2주마다 파트너사에서 공유받고 GPU 서버 두 대를 분기마다 정기적으로 업데이트하기로 했습니다.
안정성에 직접 영향을 주는 긴급 패치는 가장 먼저 반영하는 프로세스도 만들었습니다.
제목없음
이번엔 회사 전력이 부족하다
장비가 늘어날수록 운영 방식도 함께 바뀌었습니다. 5월엔 마지막으로 꽤 긴 싸움이 시작됐습니다.
2026년 3월과 4월, 3층 전기 사용량이 계약전력을 넘어섰고 한전에서 초과분 할증 요금 안내를 받았습니다.시기를 보면 H200 서버를 도입한 직후였습니다.
사용 기간
사용량
비고
1-2월
6,103 kWh
2-3월
5,886 kWh
3-4월
7,815 kWh
H200 서버 도입
4-5월
7,756 kWh
할증 금액 자체는 크지 않았지만 앞으로 GPU를 더 추가할 계획까지 고려하면 전력 여유를 확보해야 했습니다.
가장 정석적인 방법은 서버실이 있는 3층의 계약전력을 올리는 것이었습니다.
그러려면 1층 메인 분전함부터 3층까지 전기 케이블을 전부 교체해야 했고 건물 전체 정전도 필요했어요.
다른 방법을 찾던 중 재미있는 사실을 하나 발견했어요.
과거 이 건물에 있던 회사가 6층을 서버실로 썼는데, 그때 쓰던 전력 배선이 5, 6층에 그대로 남아 있었습니다.
건물 전체 계약전력 총량은 원래 167kW였습니다. 이미 있는 전력 구조를 다시 살릴 수 있겠다는 생각이 들었습니다.
5, 6층의 계약전력을 10kW에서 28kW로 되살리고 서버실 일부 장비를 그쪽 전력에 연결하기로 했습니다.
5월 30일 토요일, 6시간 동안 신규 판넬을 설치하고 스탠딩 에어컨과 GPU 에어컨, GPU Rack의 차단기를 옮겼습니다.
건물 전체를 정전시키지 않았고 대규모 케이블 공사도 피할 수 있었습니다.
이제 전력 문제는 해결됐다고 생각했습니다.
물론 이제까지 계속 그랬듯 (…) 그렇게 쉽게 끝나지 않았어요.
제목없음
Brown-out
6월 6일, 두 GPU 서버에서 동시에 전원 오류 로그가 발견됐습니다.
로그에 남은 핵심 단어는 "Brown-out".
전압이 불안정해지자 서버가 위험을 감지하고 스스로 전원을 차단했습니다.
당시 GPU 서버로 들어오는 전원의 절반은 벽에서 직접, 나머지 절반은 UPS를 거쳐 공급되고 있었습니다.
확인해보니 UPS 쪽 전원은 안정적인데 벽 전원의 전압이 그렇지 않았습니다.
우선 모든 전원선을 UPS 쪽으로 옮겼습니다.
그리고 근본 대책으로 전압조정기(AVR)를 도입하기로 했습니다. 정밀 장비에 일정한 전압을 공급해주는 장치입니다.
6월 16일 오전 9시 45분, 전압조정기 설치를 마쳤습니다. 하지만 이것만으로 문제가 끝난 건 아니었습니다.
같은 날 낮 12시엔 전원 분배 장치의 차단기가 저절로 내려가는 문제까지 추가로 생겼습니다.
따져보니 전원 분배 장치가 버틸 수 있는 최대 전력은 약 3,520W, 16A였는데,
규격상 16A까지 견뎌야 할 장치가 실제로는 11~12A 정도에서 차단되고 있었습니다.
결국 6월 25일 전원 구성을 다시 손봤습니다. 벽 전원 쪽 장치는 16A에서 32A로 올려 향후 GPU 증설까지 버틸 수 있게 했습니다.
UPS도 하나의 포트에 몰아주던 구조에서 여러 포트로 분산하는 방식으로 바꿨습니다.
그리고 마침내 6월 6일부터 다섯 차례나 반복됐던 GPU 서버 중단이 멈췄어요.
전력 문제를 해결하려고 건물 계약전력부터 UPS 용량과 전압 안정성, 전원 분배 장치의 실제 부하까지 확인했습니다.
GPU 서버를 운영할 때는 서버의 소비전력만 계산해서는 부족하다는 사실을 이 과정에서 확실하게 배웠습니다.
건물이 쓸 수 있는 전체 전력, UPS 여유 용량, 전원 분배 장치가 견딜 수 있는 부하, 공급 전압의 안정성까지 하나의 세트로 함께 설계해야 했습니다.
제목없음
그리고 12장이 된 GPU
2026년 6월, H200 GPU 4장을 추가로 도입하기로 했습니다.
당시 L40S 4장과 H200 4장, 총 8장의 GPU가 있었지만 처리해야 할 작업의 규모는 훨씬 빠르게 커지고 있었습니다.
내부 논문 300만 건 본문 추출과 OA 논문 1,100만 건 OCR, 참고문헌 추출, 리랭커 모델 학습이 한꺼번에 쌓여 있었습니다.
기존 자원으로 순차 처리하면 일부 핵심 작업은 2029년까지 밀릴 것으로 예상됐고요.
GPU를 4장 단위로 늘린 데엔 기술적인 이유가 있었습니다.
GPU는 NVLink로 묶어 함께 연산할 때 성능이 극대화되는데, 기존 4장에 2장만 더하면 두 묶음으로 갈라져 6장을 사도 사실상 4장 수준에 그칩니다.
4장을 더해야 8장이 하나의 묶음으로 동작하거든요.
기대 효과는 이렇게 계산됐습니다.
본문 추출(300만 건): 약 2.9년 → 약 9개월
OA OCR(1,100만 건): 약 6개월 → 약 3개월
참고문헌 추출: 약 7개월 → 약 3개월
리랭커 모델 학습: 약 8개월 → 약 4개월
구매와 렌탈도 다시 비교했습니다. 두 곳 견적을 확인해보니 1년치 렌탈 비용이 구매 비용과 비슷한 수준이었습니다.
대량 작업이 1년 이상 이어진 뒤에도 계속 GPU를 쓸 예정이었기 때문에 구매를 선택했고요.
그 과정에서 조금 뼈아픈 사실도 확인했는데요, 동일한 H200 4장 가격이 7개월 만에 60% 이상 올라 있었습니다.
GPU 시장에서는 결정을 미루는 시간 역시 비용이라는 걸 그때 체감했습니다.
마지막 증설을 앞두고 이번엔 GPU보다 UPS부터 확인했습니다.
H200 4장을 추가하면 약 2.5kW의 UPS 전력이 더 필요했는데, 기존 10kW UPS는 이미 65%를 쓰고 있어서 새 GPU까지 연결하면 사용률이 90%에 가까워질 상황이었습니다.
그래서 10kW UPS 한 대를 추가하고 신규 UPS는 5월에 미리 확보해둔 5층 전력에 연결했습니다.
앞선 장애에서 배운 걸 다음 증설에 하나씩 반영했습니다.
그리고 2026년 7월 31일, H200 GPU 4장을 추가로 장착했습니다.
L40S 4장과 H200 8장을 합쳐 총 12장의 GPU를 운영하는 체제가 완성됐습니다.
신규 UPS를 설치하고 전원 구성을 다시 정리했으며 펌웨어도 일괄 패치했고요.
마지막으로 GPU 12장을 모두 가동한 상태에서 냉방과 전력 부하를 직접 측정했습니다.
전체 전력 사용량은 8.8kW였습니다.
기존 UPS는 약 15분, 새 UPS는 약 30분을 버틸 수 있었습니다.
정전이 발생하더라도 GPU 서버를 안전하게 종료할 시간을 확보한 거예요.
첫 번째 L40S 서버를 들여온 지 약 1년 만이었습니다.
제목없음
냉각기가 멈추다
2025년 12월 23일 오전 10시 35분, 랙 전면 화면까지 먹통이라 화면으로 문을 열 수도 없는 상황이 찾아왔습니다.
제조업체와 통화하면서 랙 후면 차단기를 내렸다가 다시 올려 내부 제어 장치를 재부팅했습니다.
약 5분 뒤 냉각 기능이 다시 돌아왔습니다.
그사이 AI 사업부에는 GPU 작업을 잠시 멈춰달라고 요청해 발열부터 줄였습니다.
장애를 인지하고 정상화하기까지 약 40분이 걸렸습니다.
확인해보니 진짜 원인은 냉각 랙 안에 들어 있던 작은 제어 컴퓨터였습니다.
냉각기가 작동하는 순간 전력이 튀면서 제어 장치가 영향을 받은 것으로 추정됐습니다.
제어 장치는 새 제품으로 교체했습니다. 전기 노이즈를 줄여주는 장치도 함께 추가했어요.
이 일을 겪고 나서 긴급 대응 매뉴얼을 만들었습니다.
장애가 발생했을 때 누가, 언제, 무엇을 해야 하는지 5단계로 정리한 문서입니다.
덕분에 나중엔 담당자가 자리에 없어도 다른 팀원이 같은 장애를 그대로 처리할 수 있게 됐습니다.
제목없음
이제 서버실에 가지 않아도 GPU 상태를 봅니다
지난 1년 동안 겪은 장애에는 공통점이 있었습니다.
대부분 문제가 발생하고 난 뒤에야 이상을 알아챘습니다.
온도가 올라간 뒤에 알림을 확인했고 서버가 꺼진 뒤에 로그를 살펴봤고 전력이 끊긴 다음에 케이블을 따라가며 원인을 찾았습니다.
그래서 2026년 7월엔 GPU 서버 전용 모니터링 체계를 구축했습니다.
두 대의 GPU 서버에서 GPU 사용률과 온도, 전력 소비량, 메모리 사용량을 15초 간격으로 수집해서 기존 사내 모니터링 시스템으로 보내고 하나의 대시보드에서 확인할 수 있게 했습니다.
이제 담당자가 직접 서버실 문을 열어보지 않아도 GPU 12장이 무엇을 하고 있는지 볼 수 있어요.
온도가 올라가는지, 전력을 얼마나 쓰고 있는지, GPU 메모리는 어느 정도 쓰고 있는지도 한 화면에서 확인할 수 있습니다.
임계치를 넘었을 때 사내 메신저로 자동 알림이 가도록 만드는 게 다음 단계입니다.
제목없음
2편을 마치며
2025년 4월부터 2026년 7월까지, GPU 서버와 관련해 올린 구매·공사 기안만 총 10건이었습니다.
GPU 서버 두 대와 추가 GPU부터 서버실 확장 공사, 방음문, GPU 전용 냉각 Rack, 스탠딩 에어컨, UPS 교체와 증설, 전기 증설, 전압조정기, 전원 분배 장치, 온도 센서까지 다양한 장비와 공사가 이어졌습니다.
전체 투자비에서 가장 큰 비중을 차지한 건 GPU 장비였습니다.
하지만 GPU가 오늘도 서버실에서 계속 돌아가려면 그 주변의 수많은 장치가 함께 작동해야 했습니다.
온도가 올라갔을 때 알려주는 작은 센서가 있었고 정전이 났을 때 시간을 벌어주는 UPS가 있었어요.
그리고 그 뒤엔 사람들의 시간도 있었습니다.
장애가 날 때마다 서버실로 향하고, 로그를 확인하고, 협력업체와 원인을 찾고, 같은 일이 다시 생겼을 때 더 빨리 대응할 수 있도록 기록을 남긴 시간입니다.
1년 4개월을 돌아보면 이런 것들을 배웠습니다.
GPU 서버 도입은 인프라 공사입니다. 장비 견적뿐만 아니라 계약전력과 냉방이 굉장히 중요합니다.
알림은 가장 값싼 보험입니다. 프로젝트에서 가장 저렴했던 온도 센서가 억대 장비를 여러 번 지켜줬어요.
기록해두지 않으면 같은 장애를 두 번 겪습니다. 원인과 조치, 재발 방지책을 남겨둔 덕분에 후속 대응 시간이 크게 줄었습니다.
결정을 미루는 것도 비용이 될 수 있습니다. 같은 GPU 가격이 7개월 만에 60% 넘게 올랐기 때문이에요.
지금 누리미디어 사내 서버실에서는 GPU 12장이 돌아가고 있습니다.
12시간짜리 밤샘 공사와 추석 새벽의 장애 대응, 영하 1도가 된 서버실로 향했던 새벽 출근이 없었다면 이 12장은 지금처럼 조용히 돌아가지 못했을 거예요.
이 1년 4개월 동안 클라우드가 조용히 대신해주던 일들을 하나씩 직접 설계하고 책임져 봤습니다.
서버 한 대를 들이는 일에서 시작했지만, 결국 냉방과 전력, UPS, 모니터링, 장애 대응까지 함께 만들어가는 일이 됐습니다.
돌이켜보면 이 프로젝트의 결과는 GPU 12장만은 아니었습니다.
문제가 생길 때마다 원인을 찾고 그 경험을 다음 설계에 반영하면서, 처음에는 없었던 운영 기준과 대응 방식이 하나씩 생겼습니다.
앞으로 GPU가 몇 장까지 늘어날지는 모르겠습니다.
다만 다음 장비가 들어왔을 때는 지금보다 훨씬 덜 헤맬 것 같습니다.
지난 1년 4개월의 시행착오가 이제는 다음 확장을 위한 기준이 되어 있기 때문입니다.
여기까지 읽어주셔서 감사드립니다.