post
Unsloth, Qwen3.8 2.4T를 397GB로 줄여 로컬 실행 지원
Unsloth가 Qwen3.8-2.4T의 양자화 모델을 공개했습니다. 4.89TB 용량의 원본을 Dynamic 1-bit 기술로 397GB까지 줄였으며, 여러 도구와의 연동을 지원합니다.
한 줄 요약
Unsloth가 Qwen3.8-2.4T 모델의 양자화 버전을 공개해 4.89TB의 원본을 397GB까지 줄였다.
핵심 내용
BF16 원본은 4.89TB 용량이었으나 Dynamic 1-bit 양자화로 397GB까지 축소, 약 91% 크기 감소
1-bit부터 8-bit/BF16까지 다양한 버전을 제공하며, 중요한 레이어는 높은 정밀도 유지
Unsloth Dynamic 양자화 기술로 레이어별로 다른 정밀도 적용
llama.cpp, Ollama, LM Studio, vLLM, SGLang 등 다양한 도구로 실행 가능
Unsloth Desktop에서 Mac/Windows/Linux로 실행 가능하며 멀티 GPU 구성 지원
로컬 API 서빙으로 Pi, OpenClaw, Hermes 같은 에이전트의 백엔드로 연결 가능
왜 중요한가
Qwen3.8 Max 급 모델을 워크스테이션급 하드웨어에서 직접 실행할 수 있게 되었다. 이는 클라우드 서비스 비용이나 API 호출 제약에서 벗어나 조직이 자체 인프라에서 대규모 LLM을 운영할 수 있음을 의미한다. Qwen 개발팀의 발표에 따르면 일반 사용자용 27B 버전도 이번 주에 공개될 예정으로, 개인 사용자도 이 기술의 혜택을 받을 수 있게 될 것으로 보인다.
참조한 것 · 가져온 것
원문: https://unsloth.ai/docs/models/qwen3.8
GeekNews: https://news.hada.io/topic?id=32456