llama.cpp 공식 사이트 오픈
원제: llama.cpp
왜 중요한가
프라이버시 중심의 로컬 AI 실행 수요가 증가하는 가운데, 광범위한 하드웨어 지원과 주요 최신 모델 통합으로 엣지 AI 생태계 확장에 기여한다.
오픈소스 로컬 AI 추론 엔진 llama.cpp가 공식 웹사이트 llama.app을 공개했다. GitHub 스타 수 12만 3,500개를 기록한 이 프로젝트는 API 키나 텔레메트리 없이 사용자 컴퓨터에서 직접 최신 AI 모델을 실행할 수 있으며, Qwen 3, Gemma 4, GPT-OSS 등 최신 모델을 지원한다.
llama.cpp는 로컬 환경에서 대형 언어 모델(LLM)을 실행하기 위한 오픈소스 추론 엔진으로, 공식 홈페이지 llama.app을 새롭게 공개했다. GitHub에서 12만 3,500개 이상의 스타를 보유한 이 프로젝트는 외부 API 키 없이, 텔레메트리 수집 없이 사용자의 기기에서 완전히 독립적으로 동작하는 것을 핵심 가치로 내세운다.
지원 하드웨어는 Apple Silicon(M Pro·M Max·M Ultra), NVIDIA RTX 3090·4090·5090·A100·H100, AMD MI300·Radeon RX B200, Intel Arc, NVIDIA Jetson, DGX Spark, Google Cloud T4 등 광범위하며, 단일 바이너리로 노트북부터 클러스터까지 동일한 최적화 커널을 사용해 실행된다.
공식 사이트에서는 `curl -LsSf https://llama.app/install.sh | sh` 명령 한 줄로 설치할 수 있으며, Homebrew 및 Winget 패키지 매니저도 지원한다. `llama serve` 명령으로 모델을 서빙한 뒤 HuggingFace의 pi-llama 플러그인과 연동하면 로컬 코딩 에이전트 환경을 구성할 수 있다.
지원 모델로는 Alibaba의 멀티모달 추론 모델 Qwen 3(Dense·MoE 변형), Google의 Gemma 4 및 Gemma 3(140개 이상 언어·128K 컨텍스트 지원), OpenAI의 첫 오픈 웨이트 모델 GPT-OSS(함수 호출·툴 사용 지원) 등이 포함된다.