본문으로 건너뛰기
뉴스 목록으로

BITCOS, 1.58비트 장벽을 현실 비용으로 깼다

BITCOS, 1.58비트 장벽을 현실 비용으로 깼다

모델 압축 경쟁은 더 낮은 비트 수 선언보다 실제 분포와 언팩 비용을 함께 최적화하는 방향으로 이동하고 있다.

AI 뉴스를 놓치지 마세요

매주 핵심 AI 소식을 이메일로 받아보세요.

1.58비트라는 이론값 아래의 실용적 틈

arXiv 2609.16338 논문 "Breaking the 1.58-bit Barrier for Ternary LLMs"는 ternary LLM의 저장 형식을 다시 묻는다. ternary 모델은 각 가중치를 -1, 0, +1 중 하나로 저장하기 때문에 흔히 log2 3, 약 1.585비트가 이론적 기준처럼 쓰인다. 하지만 실제 배포에서는 다섯 개 ternary 값을 1바이트에 넣는 five-trit packing이 쓰이고, 그룹 크기 제약 때문에 1.625 bits per weight에 가까워진다.

논문의 관찰은 단순하다. 세 기호가 균등하게 나오지 않는다. 연구진은 29개 ternary LLM에서 0의 비율이 최대 51.5%까지 올라간다고 보고했다. 그래서 BITCOS는 dense presence bitmap과 compacted sign vector를 나누어 저장한다. 0 밀도를 z라고 할 때 비용은 2 - z bits per weight가 된다. 가장 sparse한 모델에서는 1.485 bits per weight까지 내려갔고, 29개 중 26개에서 기존 five-trit packing보다 작았다.

저장만 줄인 것이 아니라 언팩까지 봤다

압축 형식은 저장소에서만 이기면 부족하다. 추론 중에는 압축된 가중치를 빠르게 풀어 행렬-벡터 연산에 공급해야 한다. BITCOS 논문은 AVX-512, AVX2, Intel Xe2 GPU용 언팩 시퀀스를 제시하고, 최신 ternary matrix-vector multiplication 커널 대비 최대 1.28배 실현 이득을 보고했다. end-to-end decode throughput은 CPU에서 최대 1.18배, GPU에서 최대 1.27배 개선됐다.

애플 Neural Engine, 50GB/s를 되찾다, vLLM의 AMD speculative decoding, 추론비 경쟁의 다음 축, EU 수리성 공백, 온디바이스 AI 시대의 약한 고리가 모두 말한 흐름은 같다. 온디바이스와 저비용 추론은 모델 파일 크기, 메모리 대역폭, 커널 언팩의 합산 게임이다.

비교 항목five-trit packingBITCOS의미
가정-1, 0, +1 균등0이 많다는 실제 분포데이터 분포 활용
저장 비용실무상 1.625 bpw2 - z bpw0 밀도 높을수록 유리
보고 결과기준 형식26/29 모델에서 더 작음범용성 가능성
실행 성능기존 커널 최적화최대 1.28배 커널 이득언팩 비용까지 고려

한국 제조와 모바일 AI에 주는 신호

한국 기업에 중요한 지점은 "작은 모델을 쓴다"가 아니다. 같은 모델을 어떤 레이아웃으로 저장하고, 어떤 커널로 풀고, 어떤 메모리 계층에서 흐르게 할지가 제품 경쟁력이 된다는 점이다. 스마트폰, TV, 자동차, 로봇, 노트북에 들어가는 AI는 클라우드 GPU처럼 넉넉하지 않다. 모델이 조금 작아지는 것보다 메모리 대역폭과 배터리 사용량이 줄어드는 것이 더 직접적인 차이를 만든다.

특히 ternary LLM은 BitNet b1.58 논문 이후 "거의 1비트 모델"이라는 구호와 함께 주목받았다. BITCOS는 그 구호를 저장 형식과 명령어 수준으로 내린다. MLC LLM, llama.cpp, vLLM 같은 런타임 생태계에서 이런 형식이 실제로 채택되려면 모델 포맷, 커널, 벤치마크가 함께 움직여야 한다.

"비트 수"보다 "시스템 효율"을 봐야 한다

모델 압축 홍보는 종종 숫자 하나로 끝난다. 4비트, 2비트, 1.58비트 같은 식이다. 하지만 제품팀이 봐야 할 숫자는 더 복합적이다. 디스크 저장 크기, 메모리 상주 크기, 언팩 지연, 배치 크기별 처리량, 품질 하락, 하드웨어별 편차가 모두 필요하다. BITCOS가 흥미로운 이유는 저장 이론과 실행 커널을 같은 논문 안에서 다뤘기 때문이다.

결론은 신중하지만 분명하다. ternary LLM이 주류가 되려면 모델 구조만으로는 부족하다. 실제 가중치 분포를 읽고, 그 분포에 맞는 포맷을 만들고, 프로세서가 좋아하는 방식으로 풀어야 한다. AI 인프라 경쟁은 점점 더 모델 파일 안쪽과 캐시 라인 가까운 곳으로 내려가고 있다.

자주 묻는 질문

Q1: BITCOS는 새 모델 아키텍처인가요?

A: 아닙니다. ternary LLM 가중치를 더 효율적으로 저장하고 언팩하는 레이아웃입니다.

Q2: 왜 0의 비율이 중요한가요?

A: 0이 많으면 presence bitmap으로 0 위치를 표시하고, 나머지 부호만 따로 저장해 비트를 줄일 수 있습니다.

Q3: 1.485 bits per weight는 항상 나오나요?

A: 아닙니다. 논문에서 가장 sparse한 모델 기준이며, 0 밀도에 따라 달라집니다.

Q4: 품질 손실이 생기나요?

A: 논문 초점은 기존 ternary 가중치의 저장 레이아웃이므로, 별도 양자화로 품질을 다시 낮추는 접근과는 다릅니다.

Q5: 실무 도입의 관건은 무엇인가요?

A: 런타임 지원입니다. 모델 포맷과 CPU/GPU 커널이 함께 지원해야 실제 제품 이득이 납니다.

관련 토픽 더 보기

#infrastructure#ai-agent모델 압축추론 비용온디바이스 AIAI 하드웨어

📰 원본 출처

arxiv.org

이 기사는 AI 기술을 활용하여 작성되었으며, 원본 뉴스 소스를 기반으로 분석 및 해설을 추가한 콘텐츠입니다. 정확한 정보 전달을 위해 노력하고 있으나, 원본 기사를 함께 확인하시기를 권장합니다.

공유

관련 기사