"Jetson LLM" 키워드로 분류된 글 모음.
대규모 언어 모델(LLM)을 엣지 디바이스에 배포하는 것은 성능과 전력 효율성의 문제입니다. 본 가이드는 모델 양자화(Quantization)부터 TensorRT를 활용한 최적화, 그리고 실제 추론 파이프라인 구축까지의 전 과정을 엔지니어 관점에서 단계별로 안내합니다.