본문 바로가기

전체 글42

[LLM] Kubernetes Gateway API Inference Extension 실전 적용: InferencePool로 LLM 트래픽 라우팅하기 이 글은 Envoy Gateway, Agent Router(구 Envoy AI Gateway), 그리고 Kubernetes Gateway API Inference Extension을 다룬 스터디 내용을 정리한 것이다. HTTPRoute만으로는 왜 LLM 트래픽을 제대로 다루기 어려운지에서 출발해, InferencePool·InferenceModel CRD를 실제로 클러스터에 붙여보고 다중 모델 라우팅을 검증하는 과정, 그리고 그 밑에서 도는 실제 명령어까지 정리했다.들어가며 - 왜 HTTPRoute만으로는 부족한가일반적인 웹 서비스라면 K8s의 HTTPRoute와 Service만으로 트래픽 분산이 충분하다. 요청 하나하나의 처리 시간이 비교적 균일하기 때문에, 라운드로빈이나 커넥션 수 기반의 L4/L7 .. 2026. 9. 19.
[Kubernetes GPU 인프라] 드라이버 설치부터 GPU Operator 자동화 및 모니터링까지 Kubernetes GPU 인프라 A to Z: 드라이버 설치부터 GPU Operator 자동화·모니터링까지이 글은 Kubernetes GPU 인프라 구축을 주제로 진행한 스터디 내용을 정리한 것이다. 드라이버 설치부터 NVIDIA Container Toolkit, Device Plugin 수동 배포 과정을 먼저 짚고, 이어서 왜 실전에서는 이 과정을 GPU Operator로 자동화하는지, 그리고 DCGM 기반 모니터링을 어떻게 구성하는지까지 정리했다.들어가며 — GPU 인식은 왜 이렇게 번거로운가CPU나 메모리는 Kubernetes가 기본으로 인식하는 리소스지만, GPU는 그렇지 않다. 호스트에 드라이버가 설치돼 있어야 하고, 컨테이너 런타임이 그 드라이버를 컨테이너 내부로 노출할 방법을 알아야 하고,.. 2026. 9. 18.
[LLM] GPU 한 장으로 vLLM 서빙 최적화하기: nvidia-smi부터 벤치마크까지 이 글은 O'Reilly의 Hands-On LLM Serving and Optimization 9장(LLM Optimization in Practice)을 스터디하면서 정리한 내용이다. 책에서는 vLLM과 Qwen3-14B를 예제로 삼아 GPU 서빙 최적화 과정을 단계별로 설명하는데, 그 흐름과 인사이트를 인프라/DevOps 관점에서 재구성해봤다.들어가며 — 왜 "감"이 아니라 "측정"인가LLM 서빙을 운영하다 보면 "이 정도면 충분히 빠른가?", "GPU를 더 사야 하나?" 같은 질문에 감으로 답하게 되는 경우가 많다. 책에서도 이 지점을 먼저 짚고 시작하는데, 요지는 최적화에 만능 정답이 없다는 것이다. 어떤 하드웨어에서, 어떤 모델을, 어떤 트래픽 패턴으로 서빙하느냐에 따라 "최선의 설정"은 완전히.. 2026. 9. 6.
[LLM] LLM 서빙 프레임워크 4종 비교: vLLM, TensorRT-LLM, SGLang, llama.cpp 이 글은 Chi Wang, Peiheng Hu, 「Hands-On LLM Serving and Optimization: Hosting LLMs at Scale」(O'Reilly Media) 8장 "LLM Serving Frameworks"의 내용을 참고하여 인프라 실무자 관점에서 쉽게 재구성한 글이다.들어가며 — LLM을 서비스에 올리려는데, 뭘 써야 하지?사내 챗봇이든 고객 대상 AI 기능이든, 오픈소스 LLM을 직접 서비스에 올리기로 했다면 가장 먼저 부딪히는 질문이 있다. "vLLM이 유명하다는데, 그냥 이거 쓰면 되는 걸까?"라는 질문이다.결론부터 말하면 vLLM은 무난한 선택지가 맞다. 하지만 상황에 따라 더 나은 선택지가 따로 있다. 이 글에서는 LLM 서빙에 가장 많이 쓰이는 네 가지 프레임.. 2026. 8. 28.
[LLM] GPU 인터커넥트 완전정리: PCIe부터 NVSwitch까지 들어가며대규모 언어 모델(LLM)을 서빙하다 보면 GPU 하나로는 부족한 상황을 마주하게 된다. 모델 자체가 너무 커서 GPU 한 장의 메모리에 다 올라가지 않는 경우도 있고, 지연 시간 요구사항을 맞추기 위해 여러 GPU가 동시에 연산을 나눠 처리해야 하는 경우도 있다. 이럴 때 반드시 고려해야 하는 것이 바로 GPU 간 통신, 즉 인터커넥트(interconnect)다.아무리 빠른 GPU를 여러 장 갖추더라도 GPU끼리 데이터를 주고받는 속도가 느리면 전체 시스템 성능은 그 병목에 맞춰 떨어진다. 인터커넥트는 크게 한 서버(노드) 안에서 GPU끼리 연결하는 노드 내부(intra-node) 인터커넥트와, 여러 서버에 걸쳐 GPU를 연결하는 노드 간(inter-node) 인터커넥트로 나뉜다. 이 글에서는 .. 2026. 8. 23.
[LLM] LLM 서빙 시스템, 원리부터 직접 만들어보기 들어가며이 글은 "Hands-On LLM Serving and Optimization" 3장을 읽고 정리한 노트다. 저자는 vLLM이나 Triton 같은 특정 프레임워크를 바로 설명하는 대신, "LLM 서빙 시스템이 내부적으로 어떻게 동작하는가"를 원리(first principles)부터 직접 코드로 짚어나가는 방식을 택하는데, 그 흐름이 꽤 설득력 있어서 핵심 내용을 내 나름대로 재구성해봤다. 코드는 책에 실린 예제를 단순화·발췌한 것이라, 정확한 전체 구현이 궁금하면 책이 안내하는 GitHub 저장소를 참고하는 게 좋다.왜 프레임워크부터 배우지 않고 직접 만들어보는가오픈소스 서빙 프레임워크와 상용 솔루션은 이미 수백 개가 나와 있다. 그런데도 책이 굳이 "밑바닥부터 만들기"를 거치는 이유는 단순하다... 2026. 8. 16.