Ollama 설치 방법 총정리, 윈도우·맥 로컬 LLM 모델 다운로드와 실행 방법

로컬 LLM 윈도우 설치 방법

내 컴퓨터에서 직접 로컬 LLM을 실행해보고 싶어도 처음에는 설치부터 복잡할 것 같아 망설이게 됩니다.
모델 파일을 따로 구하고 그래픽카드 설정까지 해야 할 것처럼 느껴지는데요.
Ollama를 이용하면 설치와 모델 다운로드, 실행 과정을 몇 개의 명령어로 처리할 수 있습니다.
윈도우에서는 프로그램 화면으로도 사용할 수 있어 처음 접하는 분도 어렵지 않게 시작할 수 있어요.

 

 

Ollama는 어떤 프로그램일까요

Ollama는 Llama, Gemma, Qwen과 같은 공개 모델을 내 컴퓨터에서 실행할 수 있게 도와주는 도구입니다.
복잡한 파이썬 환경이나 모델 변환 작업을 직접 준비하지 않아도 되고, 원하는 모델 이름을 선택하거나 명령어로 입력하면 다운로드부터 실행까지 이어집니다.
한 번 받은 모델은 인터넷 연결 없이도 로컬에서 실행할 수 있다는 점이 가장 큰 특징입니다.

 

 

외부 API 키나 월 구독료 없이 컴퓨터 자원을 이용하며, 입력한 문서나 질문도 기본적으로 로컬에서 처리됩니다.
다만 회사 문서나 개인정보가 포함된 자료를 사용할 때는 프로그램 특성과 별개로 소속 회사의 보안 규정부터 확인하셔야 합니다.

 

 

그래픽카드가 없어도 실행은 가능합니다.
다만 CPU만 사용하는 경우 답변 속도가 느릴 수 있으므로 처음에는 3B급처럼 작은 모델부터 테스트하는 편이 좋습니다.

 

 

윈도우에서 Ollama 설치하는 순서

윈도우에서는 Ollama 공식 다운로드 페이지에서 설치 프로그램을 받은 뒤 실행하면 됩니다.
설치 화면에서 진행 버튼을 누르면 백그라운드 서버와 프로그램이 함께 준비됩니다.
설치 후 명령 프롬프트나 파워셸에서 아래 명령어를 입력해 버전을 확인하세요.

ollama --version

 

 

설치는 끝났는데 명령어를 찾을 수 없다는 메시지가 나온다면 터미널을 완전히 닫았다가 새로 열어보세요.
설치 직후에는 경로 설정이 기존 터미널에 바로 반영되지 않을 수 있습니다.
Ollama 서버는 기본적으로 11434 포트를 사용합니다.

 

 

윈도우 프로그램 화면에서 모델 받기

최근 버전에서는 명령어를 입력하지 않고 프로그램 화면에서도 모델을 선택할 수 있습니다.
채팅창의 모델 선택 메뉴에서 원하는 모델을 찾은 뒤 질문을 입력하면, 해당 모델이 컴퓨터에 없을 경우 다운로드가 먼저 진행됩니다.
설치가 끝나면 일반 채팅 프로그램처럼 질문을 입력해 바로 사용할 수 있어요.

 

 

맥과 리눅스 설치 방법

맥은 공식 설치 파일을 이용하거나 Homebrew에서 brew install ollama를 입력해 설치할 수 있습니다.
터미널 방식으로 서버를 직접 실행할 때는 아래 명령어를 사용합니다.

ollama serve

 

 

서버를 실행한 터미널은 그대로 열어두고, 새 터미널에서 모델 실행 명령어를 입력하면 됩니다.
리눅스에서는 다음 설치 스크립트를 이용할 수 있습니다.

curl -fsSL https://ollama.com/install.sh | sh

 

 

모델 다운로드와 실행은 이렇게 합니다

설치가 끝났다면 ollama run 뒤에 원하는 모델 이름을 붙이면 됩니다.
예를 들어 가벼운 Llama 계열 모델을 실행하려면 아래처럼 입력합니다.

ollama run llama3.2

 

 

컴퓨터에 모델이 없다면 먼저 다운로드가 진행되고, 완료되면 바로 대화 입력 화면이 열립니다.
대화를 종료할 때는 /bye를 입력하세요.
모델을 실행하지 않고 다운로드만 하거나 설치된 목록을 보고 싶다면 다음 명령어를 사용합니다.

ollama pull gemma2
ollama list

 

 

모델 파일은 용량이 크기 때문에 여러 개를 받다 보면 저장공간이 빠르게 줄어듭니다.
더 이상 사용하지 않는 모델은 ollama rm 모델이름으로 삭제할 수 있습니다.
저장 위치와 컨텍스트 길이는 프로그램 설정 화면에서도 확인할 수 있으며, 컨텍스트 길이를 크게 올리면 메모리 사용량도 함께 증가합니다.

 

 

컴퓨터 사양에 맞는 모델 고르기

로컬 LLM은 모델 크기가 커질수록 답변 품질이 좋아질 수 있지만 필요한 메모리도 크게 늘어납니다.
참고자료에서는 램 16GB 노트북에서 7B급 모델을 사용할 경우 답변 속도가 답답하게 느껴질 수 있다고 설명합니다.
램 8GB 환경이라면 3B 이하 모델부터 시작하는 편이 안전합니다.

 

 

맥의 통합 메모리 환경에서는 비교적 큰 모델도 실행할 수 있지만, 26B급 모델이 약 18GB 이상의 메모리를 사용하는 사례도 있습니다.
윈도우에서는 그래픽카드 메모리가 부족하면 시스템 메모리를 함께 사용하면서 속도가 크게 떨어질 수 있어요.
처음부터 큰 모델을 받기보다 작은 모델로 실행 여부와 생성 속도를 확인한 뒤 단계적으로 올리세요.

 

 

한국어 모델은 직접 비교해보세요

한국어 답변이 중요하다면 Gemma와 Qwen 계열을 먼저 비교해볼 수 있습니다.
같은 모델 계열이라도 파라미터 크기와 양자화 방식에 따라 답변 품질과 속도가 달라집니다.
한국어 자연스러움, 응답 속도, 메모리 사용량을 각각 확인한 뒤 자신의 컴퓨터에 맞는 모델을 남기는 것이 좋습니다.

 

 

다른 프로그램이나 코드에서 연결하기

Ollama는 로컬 API 서버로도 사용할 수 있습니다.
서버가 실행된 상태에서 localhost:11434 주소로 요청하면 파이썬이나 요약 프로그램, 별도 채팅 화면과 연결할 수 있습니다.
기본 실행에 익숙해진 뒤 Open WebUI 같은 별도 화면을 연결하면 모델 관리와 채팅 기록을 조금 더 편하게 사용할 수 있습니다.

 

 

처음 설치한다면 욕심내서 큰 모델부터 받을 필요는 없습니다.
Ollama 설치 후 llama3.2 같은 작은 모델을 실행하고, 한국어가 필요하면 Gemma나 Qwen 계열을 추가로 비교하는 순서가 가장 간단합니다.

 

 

결국 Ollama 설치의 핵심은 어렵지 않습니다.
운영체제에 맞게 프로그램을 설치하고, ollama run 모델이름을 입력한 뒤 컴퓨터 사양에 맞는 모델을 고르면 됩니다.
속도가 느리다면 모델 크기와 컨텍스트 길이를 낮추고, 저장공간이 부족하다면 사용하지 않는 모델부터 삭제해보세요.