로컬 LLM 코딩 비용을 줄이겠다고 고가 PC부터 사면 구독료보다 더 큰 실패 비용을 떠안을 수 있다. 제가 RTX 4090 24GB 환경에서 75~90토큰/초를 확인했지만, 주력은 클라우드로 남겼다.
테트리스는 실행됐지만 마리오형 게임은 파일 생성이 끊겼고, 다른 모델은 브라우저 테스트에서 도구 호출 오류로 멈췄다. 이 글은 모델 순위 대신 GPU 구매, VRAM 설정, 로컬·클라우드 선택 기준을 실측 장면으로 좁힌다.

고가 GPU는 월 비용보다 완료 비용이 클 때만 산다
로컬 LLM만을 위해 고가 PC부터 사지 않는다. 이미 GPU가 없고 월 클라우드 지출이 장비 감가보다 작다면 구독이 더 싸다.
영상에서는 새 로컬용 PC 비용을 5,000~7,000달러로 가정했고, Claude Sonnet 5로 두 웹 게임을 만든 특정 API 세션은 2.42달러였다. 고정 단가처럼 일반화할 수는 없다. 2026년 7월 19일 기준 Sonnet 5는 공식 가격표상 8월 31일까지 입력·출력 100만 토큰당 2달러·10달러의 도입 가격이 적용된다.
구매 전에는 최근 30일 구독·API 지출, 같은 작업 5회의 첫 실행 성공률, 사람이 복구한 시간을 함께 기록한다. 세 항목을 넣어도 로컬이 이길 때만 24GB 메모리의 RTX 4090 구매 논리가 생긴다.
24GB VRAM은 30B 모델의 진입권이지 실사용 여유가 아니다
모델 파일이 VRAM보다 작다는 이유만으로 통과시키면 안 된다. Q4 파일 약 18.6GB를 올릴 수 있었지만, 컨텍스트를 키워 일부가 시스템 RAM으로 넘어가자 70~80토큰/초가 약 2토큰/초로 추락했고 마우스까지 끊겼다.
VRAM 24GB는 모델만 넣는 상자가 아니라 IDE·브라우저·KV 캐시가 함께 쓰는 작업대다. LM Studio의 lms load 문서에서 평소 컨텍스트와 GPU 오프로딩을 넣어 메모리를 추정한 뒤, 실제 앱과 녹화를 모두 켠 상태에서도 RAM 오프로딩 없이 속도가 유지되는지 확인해야 한다.

80토큰/초보다 브라우저 테스트 완료 여부가 모델을 가른다
빠르게 코드를 뿜어도 테스트까지 끝내지 못하면 느린 선택이다. 직접 확인한 세션은 다음처럼 갈렸다.
| 실행 조건 | 관찰 속도 | 완료 결과 |
|---|---|---|
| Qwen3-Coder-30B-A3B, Q4 | 75~90토큰/초 | 테트리스 실행, 마리오형 게임 파일 생성 중단 |
| Qwen3.6-27B, Q4 | 30~33토큰/초 | 파일 생성 후 브라우저 도구 페이로드 오류 |
| Claude Sonnet 5, API | 정확한 속도 미측정 | 두 게임 첫 시도 실행, 해당 세션 2.42달러 |
두 번째 로컬 모델은 파일과 할 일 목록을 만들고 브라우저까지 열었지만, 상호작용 테스트에서 멈췄다. API 연결 성공과 에이전트 작업 성공은 별개다. 같은 모델도 하네스의 도구 스키마·완료 조건에 따라 결과가 달라지는 이유는 Coding Agent와 Coding LLM의 차이에서 이어진다.

프라이버시·오프라인·대량 반복이 아니면 하이브리드가 낫다
복잡한 일상 코딩은 클라우드를 주력으로 두고 로컬을 보조로 쓰는 편이 합리적이다. 로컬 우선 조건은 아래처럼 제한된다.
| 조건 | 선택 |
|---|---|
| 이미 24GB급 GPU가 있고 쿼터·오프라인 대비가 필요함 | 로컬 보조 |
| 코드 외부 전송이 금지됨 | 로컬 우선, IDE 확장·로그·원격 도구까지 점검 |
| 실패 비용이 낮은 반복 작업을 24시간 처리함 | 로컬 손익 검증 |
| 새 장비가 필요하고 파일·테스트·브라우저까지 자동화함 | 클라우드 주력 |
설치 엔진을 고르는 단계라면 Ollama와 Docker Model Runner 로컬 실행 비교를 먼저 보면 된다. 이 글의 최종 기준은 설치 성공이 아니라 사용 가능한 결과까지 걸린 시간이다.
FAQ: 로컬 실행이면 코드가 무조건 외부로 나가지 않나?
LM Studio 로컬 API 서버처럼 모델 추론은 PC 안에 둘 수 있지만 IDE 확장, 텔레메트리, 원격 MCP, 패키지 검색은 외부 통신을 할 수 있다. 회사 코드라면 모델 위치보다 전체 네트워크 경로와 로그 보관 설정을 확인해야 한다.
RTX 4090에서 80토큰/초가 나온 사실만으로 GPU를 살 이유는 부족했다. 첫 실행 성공률과 복구 시간을 포함한 완료 비용이 클라우드보다 낮을 때만 로컬이 주력이 된다.
'일상 > IT' 카테고리의 다른 글
| Claude Code Skills로 마케팅 대행사를 대체할 수 있을까? 자동화되는 일과 남는 일 (0) | 2026.07.23 |
|---|---|
| CPU, GPU, TPU 차이: 성능 순위보다 먼저 봐야 할 작업 기준 (0) | 2026.07.13 |
| AI로 PPT 대신 HTML 슬라이드 만들기: 쓸 만한 경우와 망하는 지점 (0) | 2026.06.28 |
| AI 콘텐츠 자동화 전 체크리스트: 작은 브랜드가 조심해야 할 신뢰 리스크 (0) | 2026.06.20 |
| 오래된 가족사진 AI 복원 전에 꼭 나눠야 할 4가지 파일 (0) | 2026.06.19 |