"LLMOptimization" 키워드로 분류된 글 모음.
클라우드 API의 한계를 극복하고 초저지연성을 확보하는 온디바이스 LLM 배포의 모든 것을 다룹니다. 양자화, ONNX, TensorRT 등 핵심 최적화 기법부터 실전 아키텍처 패턴까지, 현업에서 바로 적용 가능한 로드맵을 제시합니다.