한 줄 요약
발화자는 AMD EPYC 4585PX와 Radeon AI Pro R9700 32GB 장비에서 오픈웨이트 모델을 직접 돌려 보며, 로컬 LLM 장비 선택의 첫 관문은 원시 GPU 성능이 아니라 모델이 VRAM에 통째로 올라가느냐라고 정리한다. 결론은 로컬 모델을 프론티어 모델 대체재가 아니라 보안·반복·문서·짧은 에이전트 작업을 맡기는 “유능한 인턴”으로 보라는 것이다.
영상 메타
- URL: https://youtu.be/Rb0OVBaKYdQ
- 채널: Dante’s Datalab
- 길이: 85분 41초
- 업로드: 2026-07-03
- 조회수: 4634 / 좋아요 195
- 시청일: 2026-07-05 KST (🖥 데스크탑이 자막 추출 후 요약)
픽업
- 일반 노트북이나 미니 PC로는 만족스러운 로컬 LLM 속도와 성능을 기대하기 어렵고, 프론티어 모델 수준을 기대하고 고가 장비를 사면 장비값만 낭비할 수 있다. 발화자는 판단 순서를 ① 하드웨어 ② 모델 ③ 실제 멀티턴 검증으로 나누고, 첫 변수는 “모델이 VRAM에 통째로 올라가느냐”라고 못박는다.
- 장비 우선순위는 VRAM, 시스템 메모리, GPU 메모리 대역폭, CPU 순서다. 16
24GB 구간은 가벼운 도구 호출이나 짧은 에이전트 작업, 32GB부터는 20B32B급 모델을 코드 작성·실행·테스트·버그수정까지 이어지는 실용 에이전트 용도로 시도할 수 있고, 48GB 이상은 더 긴 멀티턴과 대형 모델을 위한 여유로 설명한다. - Q4 양자화는 모델 가중치를 16비트에서 4비트로 낮춰 용량을 약 1/4로 줄이는 균형점이며, 필요한 VRAM은 대략 “총 파라미터 수 ÷ 2 = GB”로 어림잡을 수 있다. 발화자는 큰 모델을 억지로 Q2까지 낮추는 것보다 목적에 맞는 작은 모델을 Q4로 돌리는 쪽이 대체로 낫다고 말한다.
- MoE 모델은 매 토큰마다 일부 전문가만 활성화하므로 빠를 수 있지만, VRAM에는 활성 파라미터가 아니라 총 파라미터가 올라가야 한다. 예를 들어 Llama 4 Scout는 활성 파라미터가 17B여도 총 109B라 32GB 카드에는 맞지 않는다고 설명한다.
- R9700 32GB는 RTX 5080보다 원시 속도나 가격이 절대 우위는 아니지만, 5080의 16GB VRAM으로 못 올리는 Gemma·Qwen 계열 27B~35B Q4급 모델을 올릴 수 있다는 점이 핵심이다. 추론은 학습과 달리 연산력보다 VRAM 용량과 가격의 비중이 커서, 로컬 LLM 실사용에서는 “조금 느려도 더 큰 모델을 올릴 수 있는 카드”가 이길 수 있다고 본다.
- 모델별 실험에서 Qwen 계열 27B와 35B A3B가 가장 쓸 만했고, 35B A3B는 빠르지만 간헐적 reasoning 폭주가 있었다. GLM 4.7 Flash, Kanana 2 30B, LG EXAONE/X41 32B는 텍스트 생성 자체보다 도구 호출·멀티턴 에이전트 작업에서 불안정했고, 한국어 특화 모델이라고 해서 에이전틱 작업에 곧바로 강한 것은 아니라고 평가한다.
- 로컬 LLM의 적합한 용도는 요약, 번역, 정보 추출, 분류, 내 문서 기반 RAG, 코딩 보조, 짧은 에이전트 작업이다. 복잡한 장시간 추론은 클라우드 프론티어 모델을 쓰고, 민감하거나 반복적인 업무는 로컬로 나누는 하이브리드가 현실적이며, 기대치는 “GPT-5 대체”가 아니라 “매달 API 비용 없이 굴리는 유능한 인턴” 정도라고 정리한다.
용어
- 오픈웨이트 모델 [모델 · 구독]: 모델 가중치가 공개되어 사용자가 내려받아 로컬 장비에서 직접 실행할 수 있는 LLM.
- VRAM [기타]: 그래픽 카드 전용 메모리. 로컬 LLM에서는 모델 가중치와 컨텍스트 관련 메모리가 여기에 올라가야 빠르게 돈다.
- Q4 양자화 [모델 · 구독]: 모델 가중치 정밀도를 4비트로 낮춰 용량을 줄이는 방식. 품질과 메모리 절약 사이의 실용 균형점으로 소개된다.
- MoE (Mixture of Experts) [모델 · 구독]: 전체 전문가 중 일부만 활성화해 계산하는 모델 구조. 속도는 활성 파라미터가 좌우하지만, 메모리는 총 파라미터 기준으로 필요하다.
- 활성 파라미터 / 총 파라미터 [모델 · 구독]: MoE에서 실제 계산에 참여하는 일부 파라미터와, 메모리에 올려야 하는 전체 파라미터를 구분하는 개념.
- KV 캐시 [컨텍스트 · 캐시]: 긴 컨텍스트를 처리할 때 토큰별 키·값 상태를 저장하는 메모리. 컨텍스트 길이가 커질수록 별도 VRAM을 잡아먹는다.
- which-llm [도구 통신 (MCP · CLI · API)]: 로컬 하드웨어를 읽어 실행 가능한 LLM 후보와 예상 속도를 좁혀 주는 오픈소스 CLI 도구.
- Hermes 에이전트 [하니스 · 패턴]: 로컬 모델을 연결해 웹 검색, 파일 작성, 도구 호출 등 멀티턴 작업을 시키는 에이전트 실행 환경.
- RAG [지식 · 컨텍스트 자산]: 외부 문서나 개인 자료를 검색해 모델 답변에 참고시키는 방식. 발화자는 로컬 LLM의 실용 영역 중 하나로 꼽는다.
- AMD AI PC 런처 [도구 통신 (MCP · CLI · API)]: 로컬 모델 다운로드, Hermes 연결, 웹·문서 도구, 텔레그램 봇 연동을 버튼 기반으로 묶어 주는 AMD 제공 도구로 소개된다.