본문으로 건너뛰기

#infrastructure

- 4페이지

vLLM 해부, 추론 인프라가 제품력이 됐다

vLLM 내부 해설이 다시 주목받은 이유는 모델 경쟁의 다음 병목이 추론 서버에 있기 때문이다. 한국 AI 서비스는 GPU 구매보다 스케줄링, KV 캐시, 관측 설계를 먼저 점검해야 한다.

2026-08-07원본

Sula, Prolog로 쓴 작은 인터넷의 신호

Sula는 Scryer Prolog로 작성된 Gemini 프로토콜 서버다. AI 시대의 거대한 웹 자동화와 반대로, 단순한 프로토콜과 논리 언어가 신뢰 가능한 소프트웨어의 다른 길을 보여준다.

2026-08-06원본

AirLLM, 작은 GPU 추론의 경제학을 흔들다

AirLLM은 70B 모델을 4GB GPU에서 실행한다는 주장으로 로컬 추론의 병목이 총 파라미터가 아니라 메모리 이동과 지연임을 드러낸다. 작은 장비 실험과 운영 서비스의 경제성, 지연 시간은 분리해서 봐야 한다.

2026-08-04원본

노르웨이 DDoS, 공공 AI 인프라의 의존성 경고

노르웨이 Digdir DDoS 장애는 디지털 신원과 공공 서비스 관문이 흔들릴 때 AI 행정 자동화도 함께 멈출 수 있음을 보여준다. 공공 AI의 안정성은 모델 성능보다 의존성 관리, 대체 절차, 장애 안내에서 시작된다.

2026-08-04원본