# 로컬 AI가 멍청해 보인다면, 모델을 바꾸기 전에 실행 설정부터 맞추세요 > 같은 파일이라도 돌리는 환경이 다르면 답이 갈립니다 - 매체: AI 브리핑 - 담당: 실전활용 데스크 - 분야: 활용법 - 발행: 2026-08-23T01:43:25.885Z - 원문 주소(웹): https://ai-news-1c0.pages.dev/posts/2026-08-23-%EB%A1%9C%EC%BB%AC-ai%EA%B0%80-%EB%A9%8D%EC%B2%AD%ED%95%B4-%EB%B3%B4%EC%9D%B4%EB%8A%94-%EC%A7%84%EC%A7%9C-%EC%9D%B4%EC%9C%A0-%EC%84%A4%EC%A0%95%EB%B6%80%ED%84%B0-%ED%99%95%EC%9D%B8%ED%95%98%EC%84%B8%EC%9A%94/ - 태그: 로컬LLM, 양자화, 샘플러설정, 해커뉴스, AI실전활용 --- ## 좋다던 모델이 내 PC에서만 별로였던 경험 레벨1테크스 포럼 글 "Why your local LLM feels dumber than it is"가 해커뉴스로 옮겨져 논의됐습니다. 수집 지표 기준 점수 176점, 댓글 57개. 출발점은 익숙한 장면입니다. 커뮤니티에서 "정말 좋다"는 말을 듣고 받았는데 막상 써 보니 실망했던 경험. 필자는 사람들이 대개 원본이 아니라 **양자화(파일 크기를 줄이려고 숫자 정밀도를 낮춰 압축한) 버전**을 받는다는 점을 짚습니다. ## 원문의 주장: 같은 가중치라도 계산 결과가 갈린다 필자의 결론은 **"모델이 나쁜 게 아니라 당신의 실행 환경이 다르다"**입니다. 그는 모델을 공개하고 직접 호스팅하는 연구소 쪽을 '레퍼런스 구현'이라 부르며, 그쪽 하드웨어와 소프트웨어가 내 것과 크게 다르다고 적었습니다. 가정용 장비 사용자는 세대가 다른 GPU를 섞어 쓰기도 합니다. 칩마다 명령어 집합이 달라서, 같은 가중치를 돌려도 다음에 올 조각을 계산하는 방식이 미묘하게 갈린다는 설명입니다. 규모도 작지 않습니다. 필자가 받아 본 vLLM(모델을 돌리는 실행 엔진) 최신 빌드 꾸러미에는 패키지가 734개, 그중 파이썬 패키지가 252개 들어 있었습니다. 그 코드 더미를 통과하는 경로가 사람마다 다릅니다. ## 쉽게 풀어보면 레벨1테크스 포럼에 이 글을 쓴 필자의 주장은 한 줄로 이렇습니다. **같은 AI 모델 파일을 받아도 그걸 돌리는 컴퓨터와 프로그램이 다르면 나오는 답이 달라진다는 것입니다.** 빵에 비유하면 이해가 쉽습니다. 같은 레시피라도 오븐이 다르면 빵이 다르게 나옵니다. 모델 가중치가 레시피라면 GPU와 실행 소프트웨어는 오븐과 주방 도구에 해당합니다. 양자화는 여기에 더해 재료를 값싼 것으로 바꾸는 일에 가깝습니다. 용량과 비용은 줄지만 맛이 달라질 수 있습니다. 글을 만드는 방식도 알아 두면 좋습니다. AI는 문장을 단어가 아니라 '토큰'이라는 조각 단위로 다룹니다. 영어 한 단어가 두세 조각으로 쪼개지기도 하는데, 원문이 "THE→NE→XT"처럼 토막 난 표기를 쓴 이유가 그것입니다. 모델은 조각마다 다음 후보들에 점수를 매기고, '샘플러'라는 장치가 그중 하나를 고릅니다. **온도(temperature)는 그 장치가 얼마나 과감하게 고를지 정하는 손잡이입니다.** 손잡이가 잘못 맞춰져 있으면 좋은 모델도 이상하게 답합니다. 원문은 확률이 조금만 틀어져도 "THE→NE→XT(다음)"가 "THE→NE→W→DAY(새로운 날)"로 갈라진다고 설명합니다. 조각 하나가 바뀌면 그 뒤 문장 전체가 다른 길로 갑니다. 온도를 너무 낮게 잡은 것이 Qwen 모델이 생각 구간에서 빠져나오지 못하고 맴도는 이유라고도 지적했습니다. ## 5분 점검: 모델 카드 설정을 그대로 베끼기 **당장 할 일은 모델 교체가 아니라 설정 확인입니다.** 1. 쓰는 모델의 허깅페이스 모델 카드 페이지를 엽니다. 2. 권장 샘플러 설정과 채팅 템플릿(대화를 모델에게 전달하는 형식)을 찾습니다. 원문은 "temp 1.0, top-p 0.95" 같은 값을 예로 들며 모델마다 다르다고 했습니다. 3. 실행 도구에서 그 숫자로 맞춥니다. 아래 위치는 본지가 정리한 것이며, 원문에는 도구 이름이 나오지 않습니다. - LM Studio: 채팅 화면 오른쪽 설정 패널의 Temperature, Top P 항목 - Ollama: `ollama run 모델명` 실행 후 `/set parameter temperature 1.0` - llama.cpp: 서버 실행 명령 뒤에 `--temp 1.0 --top-p 0.95` 모델을 새 버전으로 바꿨거나 실행 도구를 업데이트했다면 이 3단계를 다시 밟으세요. 권장값은 모델마다 다릅니다. 자주 막히는 지점은 둘입니다. 답이 같은 말을 반복하며 끝나지 않는다면 온도가 첫 용의자지만, 원문이 온도를 지목한 것은 Qwen의 생각 구간에 한정된 이야기입니다. 다른 모델도 원인이 같은지는 이번 자료로 확인되지 않습니다. 또 하나는 온도를 0으로 놓고 프롬프트 세 개만 넣어 판정하는 방식. 원문은 제로샷 테스트가 에이전트 작업의 대리 지표가 못 된다고 봅니다. ## 같은 모델 카드인데, 베낄 곳과 의심할 곳이 다릅니다 자료 두 대목을 붙여 보면 묘한 지점이 나옵니다. 원문은 모델 카드의 권장 설정은 그대로 따르라고 하면서, 같은 카드에 적힌 KLD(두 확률 분포가 얼마나 벌어졌는지 재는 값) 자랑 숫자는 믿지 말라고 합니다. 이유는 이렇습니다. 기준 체크포인트, 실행 환경, 평가 텍스트, 보정 데이터, 문맥 길이, 샘플 위치, KL 방향, 어휘 절단, 집계 방식까지 아홉 가지가 공개돼야 숫자 해석이 가능하다는 것. 낮은 KLD가 곧 똑똑함은 아니라고도 못박습니다. 설정값은 베끼되, 성능 자랑 숫자는 내 장비에서 직접 돌려 보기 전까지 판단을 미루라는 이야기입니다. ## 나에게 미치는 영향 **챗GPT·클로드·제미나이만 쓰는 독자도 오늘 해 볼 것이 있습니다.** 원문 필자는 온도를 0으로 놓고 테스트 프롬프트 세 개를 붙여 넣은 뒤 좋다·나쁘다 판정하지 말라며, 평가는 실제 업무를 대표해야 한다고 썼습니다. 이 조언을 일반 챗봇에 옮기면 이렇습니다(본지 해석). 새 모델이 나왔다고 짧은 질문 몇 개로 갈아타지 말고, 지난주에 실제로 처리한 업무 문서 하나를 두 서비스에 같은 문장으로 붙여 넣어 5분간 비교해 보세요. 사내 문서를 외부에 올릴 수 없어 로컬 모델을 쓰는 직장인이라면, 새 모델을 받기 전에 위 3단계부터 하세요. 비용은 0원, 수십 기가바이트 재다운로드 시간도 아낍니다. 자동화에 쓰고 있다면 얘기가 다릅니다. 댓글이 원문에서 인용한 대목에 따르면 NVFP4와 AWQ W4A16 방식의 모델이 도구 호출을 제대로 닫지 못했고, 시스코 명령도 잘못 실행했습니다(맞는 명령은 'show arp'인데 'show run'을 실행). 그러니 실제 업무에 붙이기 전에 도구 호출이 들어가는 작업 하나를 열 번 연속 돌려 보고, 중간에 형식이 깨지는 회차가 있는지 세어 보세요. 깨진다면 실행 엔진을 바꿔 같은 작업을 다시 돌려 비교하는 게 다음 수순입니다. 아래 댓글의 주장대로라면 llama.cpp나 ik_llama.cpp 계열에서는 이 실패가 나오지 않아야 하니까요. 그리고 결재·배포·명령 실행처럼 되돌리기 어려운 작업은 자동 실행을 끄고, 모델이 만든 명령을 화면에 먼저 찍은 뒤 사람이 엔터를 치도록 남겨 두세요. ## 댓글이 내놓은 반박과 이번 자료의 한계 한 댓글 작성자는 도구 호출 실패가 llama.cpp와 ik_llama.cpp에서는 일어날 수 없다고 주장했습니다. 도구 호출이 감지되면 정해진 문법을 따르도록 강제하기 때문이라는 것. 원문 필자의 반박이나 동의는 자료에 없습니다. **원문이 취약하다고 지목한 지점과 댓글이 전한 사고 지점이 겹칩니다.** 원문은 제로샷 대신 긴 문맥·도구 호출 평가를 하라고 했는데, 실제 실패도 도구 호출에서 났습니다. 자동화용이라면 여기부터 테스트하는 게 순서입니다. 다른 댓글 작성자는 인기 실행 도구의 기본 양자화가 FP16(정밀도를 낮추지 않은 기본 형식) 대비 논리력을 크게 떨어뜨린다고 단정했지만, 뒷받침하는 수치는 자료에 없습니다. 원문이 요구한 공개 기준을 원문 자신에게 되돌려 보면 어떨까. 필자는 기술적 실험 연재를 예고했는데, 이번 발췌본에는 결과 표도 수치도 없습니다. 이 대목이 걸립니다. 어떤 양자화가 성능을 얼마나 떨어뜨리는지는 이번 자료로 확인되지 않습니다. --- ## 출처 - [Hacker News] Why your local LLM feels dumber than it is — https://news.ycombinator.com/item?id=49402232 ## 집필 방식 고지 이 기사는 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인했습니다. 인용 시 출처를 "AI 브리핑"으로 표기하고 https://ai-news-1c0.pages.dev/posts/2026-08-23-%EB%A1%9C%EC%BB%AC-ai%EA%B0%80-%EB%A9%8D%EC%B2%AD%ED%95%B4-%EB%B3%B4%EC%9D%B4%EB%8A%94-%EC%A7%84%EC%A7%9C-%EC%9D%B4%EC%9C%A0-%EC%84%A4%EC%A0%95%EB%B6%80%ED%84%B0-%ED%99%95%EC%9D%B8%ED%95%98%EC%84%B8%EC%9A%94/ 로 연결해 주세요.