본문으로 건너뛰기
뉴스 목록으로

vLLM 0.28, 추론 엔진은 이제 운영체제 경쟁이다

vLLM 0.28, 추론 엔진은 이제 운영체제 경쟁이다

모델 성능 경쟁은 추론 엔진의 스케줄러, 캐시, 하드웨어 백엔드 경쟁으로 내려왔다. 한국 기업도 모델 이름보다 운영 가능한 서빙 스택과 비용 계측 능력을 먼저 봐야 한다.

AI 뉴스를 놓치지 마세요

매주 핵심 AI 소식을 이메일로 받아보세요.

0.28 릴리스의 핵심은 기능 수가 아니라 범위다

vLLM v0.28.0 릴리스 노트는 한 문장으로 요약하기 어렵다. 공개 노트 기준으로 584개 커밋, 270명 기여자, 76명 신규 기여자가 들어갔고, 저장소 자체도 GitHub에서 9만 개가 넘는 스타를 가진 LLM 서빙 표준 후보가 됐다. 눈에 띄는 항목은 Kimi-K3 최적화, DeepSeek V4 지원, speculative decoding 개선, Model Runner V2 성숙, 계층형 KV 캐시 오프로딩, 러스트 프런트엔드, 보안 수정이다.

이 릴리스가 중요한 이유는 vLLM이 단순한 모델 실행기가 아니라 추론 운영체제처럼 움직이고 있기 때문이다. GPU 커널, 스케줄러, 캐시 레이아웃, API 호환성, 멀티모달 전처리, 보안 경계가 한 릴리스 안에서 동시에 바뀐다. vLLM 문서가 강조하는 고처리량 서빙의 약속도 이제 단일 최적화가 아니라 전체 경로의 합으로 결정된다.

모델보다 경로 최적화가 비싸진다

Kimi-K3와 DeepSeek V4 항목을 보면 방향이 선명하다. 릴리스 노트는 Kimi-K3에 대해 DCP, fused FlashKDA decode and prefill kernel, adaptive speculative token budget, shared-expert sharding을 언급한다. DeepSeek V4 쪽은 sparse MLA, MTP, DSpark speculative decoding, ROCm enablement가 묶였다. 이런 변화는 모델 파일 하나를 내려받는 문제와 다르다. 같은 모델도 어느 추론 엔진, 어느 커널, 어느 캐시 정책 위에서 돌리느냐에 따라 제품 응답 시간과 GPU 비용이 달라진다.

관점예전의 모델 도입vLLM 0.28 이후의 질문
선택 기준모델 정확도와 가격모델, 커널, 캐시, 스케줄러 조합
병목프롬프트와 토큰 가격TTFT, KV 이동, GPU 동기화
운영 단위API 호출엔진 버전과 하드웨어 프로파일
리스크모델 환각장애, 회귀, 보안 엔드포인트
한국 기업 과제어떤 모델을 쓸까어떤 서빙 스택을 검증할까

BTB, 예측형 KV 복제가 LLM 추론의 새 병목을 겨냥하다는 KV 계층이 제품 비용의 중심으로 이동한다고 봤다. 이번 vLLM 릴리스도 같은 방향이다.

하드웨어 중립성은 말보다 빌드 매트릭스다

vLLM 0.28은 NVIDIA, AMD ROCm, Intel XPU, CPU 경로를 모두 다룬다. NVIDIA 쪽은 FlashInfer XQA, SM100/SM90 최적화가 보이고, AMD는 torch 2.12와 triton 3.7 스택, gfx11과 gfx950 지원이 들어갔다. Intel XPU 휠도 릴리스 파이프라인에 추가됐다. AMD ROCmIntel Extension for PyTorch 생태계가 추론 프레임워크의 실전 선택지로 들어오는 흐름이다.

한국 클라우드와 대기업 입장에서는 이것이 더 현실적이다. 모든 워크로드를 특정 GPU 한 종류에 맞출 수 없고, 조달 상황도 바뀐다. 오픈소스 추론 엔진이 여러 하드웨어 백엔드를 실제 릴리스 단위로 챙긴다면, 기업은 벤더 종속을 늦추는 협상력을 얻는다. 다만 중립성은 문서의 선언이 아니라 장애 대응과 성능 회귀 테스트로 검증된다.

보안 항목은 사소하지 않다

릴리스 노트의 보안 섹션은 sample-rate forgery로 오디오 디코드 시간 제한을 우회하는 DoS 수정, DeepStream 픽셀 제한, trust_remote_code 해석 가드, --api-key가 모든 엔드포인트를 막지 않는다는 문서 경고를 포함한다. LLM 서버는 이제 텍스트 API가 아니라 파일, 이미지, 오디오, 원격 코드, 플러그인, 구조화 출력이 모두 지나가는 입구다. 보안 경계가 얇으면 추론 비용 폭탄이나 내부 데이터 노출로 이어진다.

LLM 추론 엔진 호스트 장악 리스크, 로컬 AI의 새 공격면는 추론 런타임 자체가 공격면이 된다고 짚었다. vLLM의 보안 수정은 이 경고가 과장이 아니라 운영 이슈라는 사실을 보여준다. OpenAI 호환 API를 붙여 내부 도구를 여는 팀일수록 엔드포인트별 인증과 입력 제한을 별도로 점검해야 한다.

한국 팀의 체크리스트

첫째, 모델 벤치마크와 서빙 벤치마크를 분리해야 한다. 같은 프롬프트 정확도를 내는 모델이라도 초당 토큰, 첫 토큰 지연, 배치 안정성, 피크 메모리, 장애 복구 시간이 다르다. 둘째, 엔진 업그레이드를 라이브러리 패치가 아니라 인프라 릴리스로 취급해야 한다. 584개 커밋 규모의 변화는 성능 개선과 회귀를 동시에 가져온다. 셋째, 비용 계측은 모델 API 가격표가 아니라 실제 GPU 점유율과 캐시 적중률에서 시작해야 한다.

vLLM inference and serving guideHugging Face Text Generation Inference 같은 대안을 함께 비교하면 특정 프레임워크 종교전에서 벗어날 수 있다. 로컬 LLM 품질, 모델보다 실행 스택이 흔든다도 같은 결론에 닿는다. 모델을 고르는 일은 끝이 아니라 운영 실험의 시작이다.

자주 묻는 질문

Q1: vLLM 0.28은 바로 프로덕션에 올려도 되나요?

A: 새 기능이 많아 바로 전면 적용하기보다 대표 워크로드로 회귀 테스트를 먼저 돌리는 편이 안전하다.

Q2: 가장 중요한 변화는 무엇인가요?

A: Kimi-K3, DeepSeek V4 같은 최신 모델 최적화보다 KV 캐시, 스케줄링, 하드웨어 백엔드가 함께 성숙했다는 점이다.

Q3: 한국 스타트업도 직접 운영해야 하나요?

A: 트래픽이 작으면 관리형 API가 빠르다. 다만 지연 시간, 데이터 위치, 대량 비용이 중요해지면 자체 서빙 검토가 필요하다.

Q4: 보안 항목을 왜 봐야 하나요?

A: 추론 서버는 멀티모달 파일과 원격 모델 코드를 다룬다. 인증과 입력 제한이 약하면 일반 웹 API보다 큰 비용 피해가 생길 수 있다.

Q5: 다음 액션은 무엇인가요?

A: 현재 모델 후보를 vLLM, TGI, 관리형 API에서 같은 프롬프트와 같은 동시성으로 비교하고, TTFT와 총 비용을 함께 기록하는 것이다.

관련 토픽 더 보기

#llmAI 인프라추론 최적화오픈소스 서빙KV 캐시

📰 원본 출처

github.com

이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.

공유

관련 기사

vLLM 해부, 추론 인프라가 제품력이 됐다

2026-08-07
#infrastructure#developer-tools

vLLM 내부 해설이 다시 주목받은 이유는 모델 경쟁의 다음 병목이 추론 서버에 있기 때문이다. 한국 AI 서비스는 GPU 구매보다 스케줄링, KV 캐시, 관측 설계를 먼저 점검해야 한다.

vLLM의 AMD speculative decoding, 추론비 경쟁의 다음 축

2026-09-08
#llm

vLLM이 AMD GPU에서 speculative decoding 실험과 튜닝 지점을 공개했다. 모델 성능 경쟁은 정확도만이 아니라 토큰 처리량, acceptance rate, 메모리 여유, 운영 관측성을 함께 최적화하는 인프라 경쟁으로 이동하고 있다.

BTB, LLM 추론 병목을 캐시 예측으로 밀어내다

2026-08-01
#infrastructure#ai-agent

JW Labs의 BTB는 같은 프롬프트가 몰리는 LLM 버스트에서 KV 캐시를 미리 복제해 TTFT를 줄인다. 에이전트 원가 경쟁이 라우팅에서 메모리 운영으로 이동한다.

Intel·Google 협력 확대, AI 인프라의 숨은 병목을 겨냥했다

2026-04-10
#infrastructure#google

Intel과 Google이 Xeon CPU와 맞춤형 IPU 협력을 확대했습니다. GPU만 보던 AI 인프라 경쟁이 CPU·네트워크·보안 오프로딩으로 확장되는 흐름, 데이터센터 비용 구조, 한국 시장 함의를 함께 분석합니다.

로보플로우 AI 인프라 보안 엔지니어 채용, 컴퓨터 비전 보안 새 전환점

2026-03-05
#openai#claude

Y컴비네이터 출신 로보플로우가 AI 인프라 보안 엔지니어를 채용하며 컴퓨터 비전 보안 전문화 가속화. 국내 AI 보안 전문가 수요 급증 예상