Ollama] Gemma 4 툴 콜링 완벽 지원 & MLX 속도 2배 향상! (설치부터 파이썬 활용까지)
[Ollama] Gemma 4 툴 콜링 완벽 지원 & MLX 속도 2배 향상! (설치부터 파이썬 활용까지)
로컬 AI의 고질적인 문제였던 '작업 중단' 버그 해결과 Mac 가속 성능 총정리
그동안 내 컴퓨터에서 직접 실행하는 **로컬 AI(Local AI)**를 쓸 때 가장 답답했던 점은 무엇이었나요? 질문에 답은 잘하지만, 여러 단계를 거쳐야 하는 **복잡한 작업(Tool Calling)을 시키면 중간에 멈추거나 포기**해버리는 현상이었습니다.
최근 공개된 **Ollama 최신 업데이트**는 구글의 **Gemma 4** 모델과의 연동성을 극대화하여 이 문제를 깔끔하게 해결했습니다. 이번 글에서는 업데이트 핵심 내용과 구체적인 설치법, 그리고 실전 활용 코드까지 한눈에 알아봅니다.
- Gemma 4 툴 콜링(Tool Calling) 연속성 보장: 도구 사용 후 답변을 멈추지 않고 끝까지 수행
- Apple Silicon MLX 성능 폭발: 다중 토큰 예측(Multi-token prediction) 적용으로 속도 향상 (50 tps → 95 tps)
- 안정성 및 편의성: 메모리 누수(Memory Leak) 수정 및 작업 디렉터리 자동 인식
1. 무엇이 달라졌나? (핵심 기능 분석)
① 멀티스텝 툴 콜링(Tool Response Continuation) 지원
기존 Gemma 4 모델은 평가 벤치마크(TAU-bench)에서 높은 툴 사용 점수(86.4%)를 기록했음에도, 실제 Ollama 환경에서는 첫 번째 도구를 호출한 뒤 프로세스가 그냥 멈춰버리는 한계가 있었습니다. 이제는 AI가 도구를 호출하고 그 결과를 받아 **스스로 결과를 검토한 뒤 다음 단계까지 연속해서 작업**을 완료합니다.
② Apple Silicon (MLX) 추론 속도 2배 향상
Apple의 MLX 프레임워크에 Multi-token prediction(다중 토큰 예측) 기능이 적용되었습니다. 단어를 한 개씩 생성하는 대신 3~4개씩 미리 예측하여 처리하므로, M 시리즈 칩셋이 탑재된 Mac 기준 기존 초당 50토큰 수준에서 **최대 95토큰/초**까지 생성 속도가 크게 향상되었습니다.
2. 구체적인 설치 및 환경 설정 방법
초보자도 터미널 명령어를 통해 손쉽게 업데이트하고 모델을 준비할 수 있습니다.
STEP 1: Ollama 최신 버전 업그레이드
macOS 및 Linux 환경에서는 터미널에 아래 스크립트를 입력하여 최신 버전으로 업데이트합니다.
# macOS / Linux 최신 Ollama 업데이트
curl -fsSL https://ollama.com/install.sh | sh
# 현재 설치된 버전 확인 (v0.3.21 이상)
ollama --version
* Windows 사용자는 공식 웹사이트(ollama.com)에서 최신 설치 파일(.exe)을 받아 재설치하거나 WSL2 터미널에서 실행하시면 됩니다.
STEP 2: Gemma 4 모델 받기
툴 콜링에 특화된 Gemma 4 로컬 모델을 내려받습니다.
# Gemma 4 모델 다운로드 및 CLI 대화 시작
ollama run gemma4
STEP 3: Mac 사용자용 MLX 백엔드 확인
Apple Silicon 사용자의 경우 Ollama 실행 시 자동으로 MLX 가속 엔진이 활성화됩니다. 병렬 처리 옵션을 추가하여 실행하려면 다음 명령어를 사용하세요.
# 멀티 스레드 가속 환경에서 백그라운드 서버 실행
OLLAMA_NUM_PARALLEL=2 ollama serve
3. 실전 활용 방법: 파이썬 코드 리팩토링 에이전트
업데이트된 툴 콜링 기능을 활용해 "복잡한 파이썬 코드를 스스로 읽고, 병목 구간을 찾아서, 직접 고치고 테스트까지 수행하는 자율 에이전트"를 작성하는 방법입니다.
import ollama
# 1. Gemma 4에게 부여할 외부 도구(Tools) 정의
tools = [
{
'type': 'function',
'function': {
'name': 'read_code_file',
'description': '지정한 소스코드 파일의 내용을 읽어옵니다.',
'parameters': {
'type': 'object',
'properties': {
'filepath': {'type': 'string', 'description': '파일 경로'}
},
'required': ['filepath']
}
}
},
{
'type': 'function',
'function': {
'name': 'run_benchmark',
'description': '수정된 코드를 실행하고 속도를 측정합니다.',
'parameters': {
'type': 'object',
'properties': {
'code': {'type': 'string', 'description': '실행할 코드'}
},
'required': ['code']
}
}
}
]
# 2. Ollama API 호출
response = ollama.chat(
model='gemma4',
messages=[
{
'role': 'user',
'content': 'app.py 파일에서 병목 구간 3곳을 찾아 리팩토링하고 벤치마크 테스트까지 완료해줘.'
}
],
tools=tools
)
# 3. 모델이 적절한 도구를 선택하여 연속적으로 실행
print("에이전트 응답:", response['message'])
이전 버전에서는 파일 읽기 도구 실행 후 대답이 멈췄지만, **v0.3.21 이후부터는 파일 내용을 분석한 뒤 스스로 리팩토링을 수행하고 벤치마크 도구까지 연속해서 실행**을 완료합니다.
4. 총평
이번 Ollama 업데이트는 단순한 버그 수정을 넘어 **'로컬 AI 에이전트'의 실용성을 대폭 올려준 중요한 전환점**입니다. 민감한 데이터나 코드 보안 문제로 외부 클라우드 AI를 사용하기 부담스러웠다면, 지금 바로 업데이트하여 보안 걱정 없는 나만의 로컬 자동화 시스템을 구축해 보세요!
"더 이상 AI의 대답이 도중에 끊겨 재촉할 필요가 없습니다. 이제 로컬 AI가 부여된 작업을 끝까지 완수합니다."
댓글
댓글 쓰기