LocalAI: GPU 없이 모든 하드웨어에서 LLM, 이미지 및 비디오 실행

솔직히 말해서, 2026년에는 AI를 실행한다는 게 데이터센터 GPU를 위해 신장을 파는 일인지 모두가 고민했습니다. 그러다 LocalAI 같은 오픈소스 프로젝트가 등장해 판도를 뒤집었습니다. LocalAI는 자체 호스팅 오픈소스 AI 엔진으로, LLM, 이미지 생성, 비디오 모델, 음성 인식, 텍스트 음성 변환 등 훨씬 더 많은 작업을 GPU 없이 여러분의 기기에서, 완전한 프라이버시를 지키며 실행할 수 있습니다. API 종속(lock-in)에서 벗어날 방법을 찾고 있었다면, 이것이 바로 해답입니다.
LocalAI는 무엇이 다른가?
이 프로젝트는 스스로를 “작은 코어, 번들이 아님”이라고 설명합니다. 가능한 모든 종속성을 하나의 거대한 바이너리로 묶어 배포하는 대신, LocalAI는 구성 가능한(composable) 방식으로 설계되어, 각 백엔드가 llama.cpp, vLLM, whisper.cpp, stable-diffusion, MLX 같은 검증된 엔진을 자체 컨테이너 이미지로 감쌉니다. 그 백엔드는 모델이 실제로 필요할 때만 가져옵니다. 즉, 평생 쓸 일 없는 소프트웨어를 잔뜩 설치할 필요가 없고, 어떤 언어로든 커스텀 백엔드를 만들어 LocalAI를 확장할 수 있습니다.
LocalAI는 또한 여러분이 이미 알고 있는 API를 그대로 대체할 수 있는 제품입니다. 모든 모달리티에서 OpenAI API, Anthropic API, ElevenLabs 오디오 API와 호환됩니다. 따라서 호스팅 API용으로 작성한 코드가 이미 있고 로컬로 전환하고 싶다면, 보통 엔드포인트 URL만 바꾸면 됩니다.
GPU가 필요 없는 마법
대부분의 인기 모델은 CPU에서도 잘 실행되지만 느립니다. LocalAI는 GPU를 갖추고 있을 때 하드웨어 가속을 지원합니다. NVIDIA(CUDA 12/13), AMD(ROCm), Intel(oneAPI), Apple Silicon(Metal), Vulkan, 그리고 NVIDIA Jetson 기기까지요. CPU 노트북 하나로 시작한 다음, 작업 흐름을 바꾸지 않고 나중에 GPU로 옮겨도 됩니다. LocalAI가 GPU 성능을 자동으로 감지해 올바른 백엔드를 가져오므로, 수십 가지 환경 변수를 일일이 만질 필요가 없습니다.
10초 만에 설치
LocalAI 시작은 정말 간단합니다. 가장 빠른 방법은 Docker입니다. CPU 전용이라면 다음 한 줄만 실행하세요.
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest
NVIDIA GPU가 있나요? 맞는 CUDA 이미지를 선택하고 --gpus all을 추가하세요.
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-gpu-nvidia-cuda-13
AMD 사용자는 몇 가지 장치 플래그와 함께 HIPBLAS 이미지를 사용할 수 있고, Intel 및 Vulkan 사용자도 전용 이미지가 있습니다. 네이티브 앱을 선호한다면 공식 macOS DMG도 있습니다. 다만 Apple이 서명하지 않았으므로 설치 후 격리 속성을 제거해야 한다는 점을 잊지 마세요. 정확한 명령은 프로젝트 README에서 찾을 수 있습니다.
모델 로드: 명령 하나, 선택은 무한
모델을 로드하는 가장 쉬운 방법은 내장 명령줄 도구를 사용하는 것입니다. LocalAI는 모든 것을 다스리는 하나의 명령을 제공합니다.
local-ai run llama-3.2-1b-instruct:q4_k_m
이 명령은 LocalAI 모델 갤러리에서 모델을 가져옵니다. 하지만 그 갤러리에 제한될 필요는 없습니다. Hugging Face, Ollama 레지스트리, 또는 표준 OCI 레지스트리에서 모델을 직접 가져올 수 있습니다.
local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf
local-ai run ollama://gemma:2b
local-ai run oci://localai/phi-2:latest
심지어 LocalAI에 YAML 구성 파일을 지정해 모델 설정과 컨텍스트 길이를 원하는 대로 정확하게 정의할 수도 있습니다.
터미널 에이전트와 대화하기
모델이 로드되면 실험적이지만 매우 멋진 내장 터미널 에이전트를 사용할 수 있습니다. 단순한 REPL로 들어가는 대신, 이 에이전트는 파일을 읽고 질문에 답하며 기기에서 명령을 실행합니다. 무언가를 변경하기 전에 승인을 요청하므로 제어권은 항상 사용자에게 있습니다. 터미널에서 서버를 시작하세요.
local-ai run llama-3.2-1b-instruct:q4_k_m
그다음 다른 셸을 열고 대화하세요.
local-ai chat --model llama-3.2-1b-instruct:q4_k_m
채팅하는 동안 /models를 입력하면 설치된 모델을 볼 수 있고, /model <name>을 입력하면 대화 중간에 모델을 전환할 수 있습니다. 멋진 기능입니다. 하지만 AI가 터미널을 건드리게 할 준비가 되지 않았다면, 포트 8080에서 일반 OpenAI 호환 채팅 서버가 실행되고 있으니 원하는 클라이언트를 사용하면 됩니다.
LocalAI는 실제로 무엇을 할 수 있나요?
LocalAI의 기능 목록은 정말 압도적입니다. 텍스트 측면에는 텍스트 생성, 임베딩, 리랭커, 비전 API, OpenAI 호환 도구가 있습니다. 음성 측면에는 오디오-텍스트 변환, 텍스트-오디오 변환, WebRTC 기반 실시간 음성-음성 대화, 음성 활동 감지, 화자 분리까지 있습니다. 이미지 생성, 비디오 생성, 객체 감지, 깊이 추정도 모두 지원됩니다. 구조화된 출력이 필요하다면 제약 문법과 JSON 스키마도 지원합니다.
백엔드 갤러리에는 60개 이상의 백엔드가 포함되어 있습니다. 일부는 LocalAI 팀이 C++/GGML로 직접 만든 네이티브 엔진입니다. 전사용 parakeet.cpp, 화자 인식용 voice-detect.cpp, 그리고 GPU나 카메라 포즈 없이 몇 장의 사진을 3D 가우시안으로 바꿔주는 free-splatter.cpp가 그 예입니다. 이들은 단순한 래퍼가 아니라 런타임에 Python 추론이 필요 없는 순수 C++ 구현으로, 이식성 측면에서 인상적인 성과입니다.
최근 릴리스에서는 VRAM 인식 라우팅과 자동 확장을 갖춘 분산 모드, MCP(Model Context Protocol) 지원, 다중 사용자 할당량 관리, UI 안에서 바로 할 수 있는 파인튜닝이 추가되었습니다. 즉, 단순한 모델 실행기를 넘어 개인과 팀을 위한 완전한 플랫폼이 되어 가고 있습니다.
프라이버시 우선 AI가 마침내 실용적으로
LocalAI README에는 이 제품의 매력을 한 문장으로 요약한 말이 있습니다. “여러분의 데이터는 결코 여러분의 인프라를 떠나지 않습니다.” LocalAI를 실행하면 모든 API 요청이 여러분의 머신 안에 머뭅니다. 프롬프트 유출도 없고, 데이터가 남의 모델 학습에 쓰이지도 않으며, 규정 준수 골칫거리도 없습니다. 파인튜닝과 양자화 지원과 결합하면, 개방형 표준을 따르면서도 완전히 프라이빗한 AI 스택을 구축할 수 있습니다.
이 프로젝트는 MIT 라이선스로 제공되며 Ettore Di Giacinto와 활발한 커뮤니티가 유지 관리하고 있습니다. LocalAI 모델 갤러리에서 모델을 둘러보거나 GitHub의 퀵스타트를 따라 해 보세요. 직접 파고들다 보면 아마 동의하게 될 것입니다. LocalAI는 우리가 가진 AI 실행 방법 중 가장 보편적이고 개방적이며 윤리적으로 건전한 방식에 가장 가깝습니다.
관련 글
Deep-Live-Cam 2.1.6: 단 한 장의 사진으로 실시간 얼굴 바꾸기
단 한 장의 이미지로 실시간 얼굴을 바꾸는 오픈소스 도구 Deep-Live-Cam을 알아보세요. 설치 방법과 책임 있는 사용법을 배워보세요.
Hermes Agent: 모든 작업에서 학습하는 자기 개선 AI
Hermes Agent는 Nous Research의 오픈소스 AI 에이전트로, 시간이 지나면서 스킬을 배우고, 사용자 컨텍스트를 기억하며, 휴대폰, 노트북 또는 5달러 VPS에서 실행할 수 있습니다.
Humanizer: AI 작성을 인간답게 만드는 오픈소스 도구
Humanizer는 Wikipedia의 'Signs of AI writing'에 있는 35가지 패턴을 사용하여 AI처럼 들리는 텍스트를 자연스럽고 인간적인 글로 다시 작성합니다. 작동 방식, 전후 예시, 설치 단계를 소개합니다.
VoiceStudio 소개: 646개 언어를 지원하는 무료 로컬 우선 음성 복제
VoiceStudio는 무료 오픈소스 로컬 우선 음성 스튜디오를 데스크톱에 제공합니다. 3초 분량의 오디오로 어떤 목소리든 복제하고 단 한 푼도 들이지 않고 646개 언어로 생성할 수 있습니다.