로컬 LLM 구축 방법, 3단계로 따라하기
- 로컬 LLM은 인터넷 연결 없이 내 PC에서 직접 AI 모델을 실행하는 방식입니다
- Ollama 설치, 모델 다운로드, 인터페이스 연동 3단계로 구축할 수 있습니다
- 모델 파라미터 크기에 따라 필요한 RAM·VRAM이 크게 달라집니다
- RAG를 연결하면 내 문서 기반으로 답하는 개인화 챗봇을 만들 수 있습니다
로컬 LLM(Large Language Model, 대형 언어 모델) 구축은 Ollama 같은 실행 프레임워크를 설치하고, 원하는 모델을 내려받아 내 PC(또는 서버)에서 직접 실행하는 방식으로 진행합니다. 클라우드 API 없이도 문서 요약, 코드 작성, 챗봇 기능을 인터넷 연결 없이 로컬 환경에서 사용할 수 있다는 점이 핵심입니다. 아래에서 하드웨어 요구사항부터 실제 설치·실행 절차, RAG(검색 증강 생성, 외부 문서를 검색해 답변 정확도를 높이는 기법) 연동, 흔한 실수까지 순서대로 정리했습니다.
로컬 LLM이란? 클라우드 API와 무엇이 다른가

로컬 LLM은 OpenAI·Anthropic 같은 클라우드 API에 요청을 보내는 대신, 모델 가중치 파일을 내 하드웨어에 내려받아 오프라인으로 추론(inference)을 수행하는 방식입니다. 응답 속도와 성능은 사용하는 GPU·CPU 사양에 좌우되지만, 대신 API 사용료가 들지 않고 입력한 데이터가 외부 서버로 전송되지 않습니다.
클라우드 API 대비 장점
가장 큰 장점은 비용과 데이터 보안입니다. 사내 문서나 개인정보가 포함된 텍스트를 처리할 때 외부 API로 전송하지 않아도 되므로, 기업 환경에서는 데이터 유출 우려 없이 AI를 활용할 수 있습니다. 반복 호출이 많은 업무라면 토큰 단위 과금이 없다는 점도 매력적입니다.
클라우드 API 대비 한계
다만 로컬 LLM은 대형 상용 모델(GPT-4급) 대비 추론 품질이 낮고, 하드웨어 성능에 따라 응답 속도가 느릴 수 있습니다. 또한 모델 업데이트나 파인튜닝을 직접 관리해야 하므로 초기 설정 이후에도 어느 정도 유지보수가 필요합니다.
구축 전 확인할 하드웨어 요구사항
로컬 LLM 구축에서 가장 먼저 확인해야 할 것은 모델 파라미터 크기에 맞는 메모리 용량입니다. 파라미터 수가 클수록 답변 품질은 좋아지지만 필요한 RAM·VRAM도 비례해 늘어납니다.
| 모델 크기(파라미터) | 최소 시스템 RAM | 권장 GPU VRAM | 예시 모델 |
|---|---|---|---|
| 3B~7B | 8GB | 6GB 이상(없어도 CPU 실행 가능) | Gemma 4 E2B(유효 2.3B), Gemma 4 E4B(유효 4.5B) |
| 8B~13B | 16GB | 8~12GB | Gemma 4 12B |
| 30B 이상 | 32GB 이상 | 24GB 이상 | EXAONE 4.5 33B, Qwen3.6 35B-A3B |
위 표의 예시 모델은 확인 시점(2026-08-17) 기준 각 계열의 최신 세대입니다.
LG AI연구원은 EXAONE 3.5(2024-12, 2.4B·7.8B·32B) 이후 2025년 7월 EXAONE 4.0(32B·1.2B, 추론·비추론 통합 하이브리드)을 공개했고, 2026년 4월 9일에는 여기에 자체 비전 인코더를 결합한 후속작 EXAONE 4.5(33B, LLM 백본 약 31.7B+비전 인코더 약 1.29B, 컨텍스트 262,144 토큰)를 내놨습니다. EXAONE 4.5는 LG 최초의 오픈웨이트 비전-언어 모델(VLM)이지만, EXAONE 4.5 모델카드에 이미지 없이 텍스트만 넣는 text-only QA 사용 예시가 별도로 문서화돼 있어 순수 텍스트 로컬 챗봇으로도 쓸 수 있습니다.
Alibaba Qwen팀은 2026년 4월 Qwen3.6(27B·35B-A3B, Apache 2.0)으로 Qwen 2.5 세대를 대체한 뒤, 2026년 8월 14일에는 후속 모델인 Qwen3.8-27B(Apache 2.0, 네이티브 262,144 토큰 컨텍스트)를 다시 공개해 세대를 이어가고 있습니다.
Google DeepMind는 2026년 4월 Gemma 4를 공개했는데, 공식 발표 자료에는 E2B·E4B·26B MoE·31B Dense 4종이 소개돼 있고 Gemma 4 기술 모델카드에는 여기에 12B Unified(11.95B, 인코더 없이 이미지·오디오를 임베딩 공간에 직접 투영하는 구조)가 더해져 있습니다.
Meta도 Llama 4(Scout·Maverick, MoE 구조)로 세대교체를 진행했으므로, 모델을 받기 전 각 계열의 최신 버전을 확인하는 것이 좋습니다. 참고로 EXAONE은 4.0(32B·1.2B)과 4.5(33B) 모두 8B~13B 구간에 맞는 중간 사이즈를 아직 내놓지 않아, 이 구간에는 현세대 EXAONE 옵션이 없습니다.
GPU가 없어도 CPU만으로 7B급 모델까지는 실행 가능하지만, 응답 속도가 크게 느려집니다. 4bit 양자화(quantization, 모델 가중치를 낮은 정밀도로 압축해 용량을 줄이는 기법)를 적용하면 동일 모델도 필요 메모리를 절반 이하로 줄일 수 있습니다.
로컬 LLM 구축 방법 3단계

가장 널리 쓰이는 Ollama 기준으로 설치부터 실행까지의 절차를 정리했습니다.
1단계: Ollama 설치

Ollama는 명령어 한 줄로 로컬 LLM을 실행할 수 있게 해주는 프레임워크입니다. Windows·macOS는 공식 설치 파일을 내려받아 실행하면 되고, Linux는 아래 스크립트로 설치합니다.
curl -fsSL https://ollama.com/install.sh | sh
2단계: 모델 다운로드 및 실행
설치가 끝나면 원하는 모델을 지정해 실행 명령을 내리면 최초 1회 자동으로 모델이 다운로드됩니다.
ollama run gemma4:12b
다운로드가 끝나면 터미널에서 바로 대화형으로 질문을 입력할 수 있습니다. 한국어 응답 품질을 우선한다면 LG AI연구원이 2026년 4월 9일 공개한 EXAONE 4.5 계열 모델도 같은 방식으로 실행할 수 있는데, 아직 Ollama 공식 라이브러리에는 등록되지 않아 Hugging Face에 공개된 GGUF를 ollama run hf.co/LGAI-EXAONE/EXAONE-4.5-33B-GGUF:Q4_K_M 명령으로 직접 받아 실행해야 합니다.
3단계: 외부 도구·API로 연동
Ollama는 기본적으로 로컬 API 서버(기본 포트 11434)를 함께 띄우므로, 별도 GUI 없이도 파이썬 코드나 다른 애플리케이션에서 API 호출로 연동할 수 있습니다.
import requests
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": "gemma4:12b", "prompt": "오늘 회의 내용을 3줄로 요약해줘", "stream": False}
)
print(response.json()["response"])
클릭 기반 GUI를 선호한다면 Chatbox AI 같은 오픈소스 인터페이스를 Ollama와 연결해 사용할 수도 있습니다. 대규모 팀 환경에서 여러 AI 도구를 표준화된 방식으로 연결하려면 MCP 프로토콜을 함께 이해해두면 확장 시 도움이 됩니다.
RAG로 내 문서 기반 챗봇 만들기
단순 대화만으로는 최신 정보나 사내 문서 내용을 답할 수 없습니다. 이때 필요한 것이 RAG(Retrieval-Augmented Generation, 검색 증강 생성)로, 질문과 관련된 문서 조각을 먼저 검색한 뒤 그 내용을 근거로 답변을 생성하는 구조입니다.
RAG 파이프라인 구성 요소
- 문서 로더: PDF·워드 등 원본 문서를 텍스트(또는 마크다운)로 변환
- 텍스트 청킹(chunking): 문서를 일정 길이 단위로 분할
- 임베딩 모델: 텍스트를 벡터(숫자 배열)로 변환
- 벡터 데이터베이스: 변환된 벡터를 저장하고 유사도 검색을 수행 (ChromaDB, OpenSearch 등)
구축 시 자주 발생하는 품질 문제
PDF를 단순 텍스트로만 추출하면 표나 목록 구조가 깨져 임베딩 품질이 떨어지는 경우가 많습니다. 마크다운 형태로 변환해 문서 구조를 보존한 뒤 청킹하면 검색 정확도가 눈에 띄게 개선됩니다.
로컬 LLM 구축 시 흔한 실수와 주의사항

- 모델 크기를 과도하게 선택: 하드웨어 사양을 넘는 모델을 무리하게 실행하면 응답이 극도로 느려지거나 다운됩니다. 먼저 7B~8B급으로 테스트한 뒤 크기를 늘리는 것이 안전합니다.
- 임베딩 모델과 LLM을 혼동: 텍스트를 벡터로 바꾸는 임베딩 모델과 답변을 생성하는 LLM은 역할이 다른 별도 모델입니다. RAG 구축 시 두 모델을 각각 선택해야 합니다.
- 보안 설정 누락: Ollama API 서버를 외부에 노출된 네트워크에 그대로 열어두면 누구나 접근할 수 있어, 사내망 외부 접근을 반드시 차단해야 합니다.
- 라이선스 미확인: 일부 오픈소스 모델·도구는 상업적 이용에 제한 조건이 있으므로, 회사 업무에 활용하기 전 라이선스 조항을 확인해야 합니다.
운영 단계에서 추론 비용(전기료·하드웨어 감가상각 포함)이 예상보다 크다면, AI 추론 비용 절감하는 법을 함께 참고해 양자화·배치 처리 등으로 비용 구조를 점검해보는 것도 방법입니다.
자주 묻는 질문
Q. 그래픽카드(GPU) 없이도 로컬 LLM을 구축할 수 있나요?
가능합니다. 7B급 이하 모델은 CPU와 충분한 RAM(16GB 이상 권장)만으로도 실행할 수 있지만, GPU가 없으면 응답 생성 속도가 초 단위로 눈에 띄게 느려집니다. 실시간 대화형 챗봇으로 쓰려면 최소 6GB 이상 VRAM을 갖춘 GPU를 권장합니다.
Q. 로컬 LLM과 클라우드 LLM API 중 무엇을 선택해야 하나요?
민감한 사내 데이터를 다루거나 반복 호출량이 많아 API 비용 부담이 큰 경우 로컬 LLM이 유리합니다. 반대로 최고 수준의 답변 품질이 필요하거나 초기 하드웨어 투자가 부담스럽다면 클라우드 API가 더 적합합니다.
Q. 모델 파일은 어디에서 받나요?
Ollama를 사용하면 별도 다운로드 사이트를 방문하지 않아도 명령어 실행만으로 공식 모델 저장소에서 자동으로 받아옵니다. Hugging Face 같은 별도 플랫폼에서 GGUF 형식 파일을 직접 내려받아 연결하는 방법도 있습니다.
Q. 구축한 로컬 LLM을 여러 명이 함께 쓸 수 있나요?
가능합니다. Ollama의 API 서버를 사내망 내부에 공개하고 방화벽으로 외부 접근을 차단하면, 같은 네트워크의 여러 사용자가 하나의 서버를 공유해 사용할 수 있습니다. 다만 동시 요청이 많아지면 응답 속도가 저하되므로 사용자 규모에 맞는 GPU 사양 산정이 필요합니다.
Q. 한국어 성능이 좋은 로컬 모델은 무엇인가요?
국내 기업이 공개한 EXAONE 계열이나 다국어 학습 비중이 높은 Qwen 계열이 한국어 응답에서 상대적으로 안정적인 편으로 알려져 있습니다. 다만 모델별 실제 품질은 사용 목적(요약·번역·코드 생성 등)에 따라 차이가 있으므로 직접 테스트해보고 선택하는 것이 정확합니다.
참고자료
- LG AI Research – 차세대 하이브리드 AI, EXAONE 4.0 공개(2025-07-15)
- LG AI Research – LG 최초 오픈웨이트 비전-언어모델, EXAONE 4.5 공개(2026-04-09)
- Hugging Face – EXAONE-4.5-33B 모델카드
- Hugging Face – EXAONE-4.5-33B-GGUF(양자화 배포, Ollama hf.co 직접실행 명령 포함)
- GitHub QwenLM – Qwen3.6 공식 저장소
- Hugging Face – Qwen3.8-27B 모델카드(Alibaba Qwen팀, 2026-08-14 공개)
- Google – Gemma 4 공식 발표(2026-04-02)
- Google AI for Developers – Gemma 4 모델카드
- Hugging Face – Llama 4 Scout 모델 카드(Meta)
