# 딥시크 V4 플래시 비전 실험판 공개… "이미지 인식 안 된다" 불만 터져 > 딥시크 새 비전 모델, 벤치마크는 높은데 실사용에선 "이미지 무시" 불만 쏟아져 - 매체: AI 브리핑 - 담당: 모델 분석 데스크 - 분야: 신모델 - 발행: 2026-09-01T02:40:27.607Z - 원문 주소(웹): https://ai-news-1c0.pages.dev/posts/2026-09-01-%EB%94%A5%EC%8B%9C%ED%81%AC-v4-%ED%94%8C%EB%9E%98%EC%8B%9C-%EB%B9%84%EC%A0%84-%EC%8B%A4%ED%97%98%ED%8C%90-%EA%B3%B5%EA%B0%9C-%EC%9D%B4%EB%AF%B8%EC%A7%80-%EC%9D%B8%EC%8B%9D-%EC%95%88-%EB%90%9C%EB%8B%A4-%EB%B6%88%EB%A7%8C-%ED%84%B0%EC%A0%B8/ - 태그: 딥시크, 멀티모달, 오픈소스모델, 실사용후기, 모델분석 --- ## 딥시크가 실험판 비전 모델을 조용히 올렸다 중국 AI 스타트업 딥시크(DeepSeek)가 'DeepSeek-V4-Flash-Vision-Exp'를 허깅페이스(Hugging Face)에 공개했다. 모델 이름에 'Exp(실험판)'가 붙은 점, 별도 블로그나 기술 리포트가 없는 점으로 미뤄 정식 출시가 아닌 테스트 성격이 강해 보인다. 허깅페이스 페이지 외에 공식 발표문은 확인되지 않았다. ## 커뮤니티 반응은 싸늘하다 해커뉴스(Hacker News)와 레딧 r/LocalLLaMA에 관련 글이 올라왔지만 반응은 미지근하다. 해커뉴스 게시물은 점수 20, 댓글 5개에 그쳤고, 레딧 두 게시물도 합쳐서 댓글이 0개다. 모델에 대한 관심 자체가 낮거나, 써본 사람이 적다는 뜻으로 읽힌다. ## "이미지 보여줘도 텍스트만 답한다" — 실사용자 불만 해커뉴스 댓글 중 가장 눈에 띄는 건 실사용 불만이다. > "이 버전은 그다지 인상적이지 않다. 쓰다 보면 시각 능력이 없는 것처럼 굴고, 이미지를 인식하지 않으려 한다. 내가 상기시켜줘야 그때서야 본다." — 해커뉴스 사용자 멀티모달 모델의 핵심 기능인 이미지 인식이 안정적으로 작동하지 않는다는 지적이다. 프롬프트에 이미지를 첨부해도 텍스트 전용 모델처럼 동작한다는 후기가 여럿 보인다. ## 벤치마크는 텍스트 전용 모델보다 높다는데 다른 댓글에선 의외의 벤치마크 결과가 거론된다. > "이게 텍스트 전용 모델보다 벤치마크상으론 더 잘 나온다는 게 솔직히 놀랍다. 비전 기능이 추가되면 텍스트 능력이 좀 떨어질 줄 알았다." — 해커뉴스 사용자 비전 학습이 텍스트 성능을 해치지 않고 오히려 도왔다는 '크로스 트레이닝' 효과를 시사하는 대목이다. 다만 벤치마크 수치 자체는 원문에서 확인할 수 없어 어디까지 믿어야 할지 불확실하다. ## 모델 크기·구조는 여전히 비공개 파라미터 수(모델의 두뇌 용량에 해당하는 수치), 맥락 길이(한 번에 처리할 수 있는 텍스트·이미지 양), 라이선스 등 핵심 스펙은 허깅페이스 페이지에도 적혀 있지 않다. 해커뉴스에선 "오퍼스(Opus) 같은 폐쇄 모델도 실제론 3000억~4000억 파라미터 MoE(전문가 혼합) 모델에 후학습을 많이 한 것 아니냐"는 추측만 오간다. 공식 자료가 없으니 모든 게 추측 영역이다. ## 쉽게 풀어보면 딥시크가 이미지까지 보는 새 모델을 시험 삼아 공개했습니다. 그런데 써본 사람들 사이에서 "이미지 올려도 안 보고 텍스트만 대답한다"는 불만이 나옵니다. 벤치마크 점수는 텍스트 전용 모델보다 높다는 이야기가 있는데, 실제 쓸 땐 비전 기능이 불안정하다는 뜻입니다. 모델 크기나 라이선스 같은 기본 정보도 아직 안 나왔습니다. 한마디로 **'써보라고 내놓은 건데, 막상 쓰니 이미지를 무시한다'**는 게 현장 반응입니다. ## 나에게 미치는 영향 - **일반 사용자**: 지금 이 모델을 다운로드해 이미지 분석용으로 쓰기엔 무리가 있습니다. 이미지 인식이 안 되면 프롬프트에 "이미지 봐줘"라고 명시해야 하는데, 그조차 매번 통하지 않는다고 합니다. - **개발자·연구자**: 허깅페이스에서 가중치를 받아 파인튜닝(재학습) 기반으로 쓸 수는 있겠지만, 베이스 모델 자체가 비전 추론이 불안정하면 파인튜닝으로 고치기 어렵습니다. 라이선스 확인이 선행돼야 합니다. - **기존 딥시크 사용자**: 텍스트 전용 V4를 쓰고 있다면, 이 실험판으로 갈아탈 이유는 없어 보입니다. 비전 기능이 필요하면 제미나이·GPT-4o·클로드 같은 검증된 멀티모달 서비스를 쓰는 게 낫습니다. ## 남은 쟁점 1. **공식 스펙 공개 여부** — 파라미터 수, 맥락 길이, 라이선스가 나와야 상업·연구 활용 가능성을 가늠할 수 있다. 2. **비전 모듈 안정화** — "이미지 무시" 버그가 아키텍처 문제인지, 단순 가중치 초기화 문제인지 파악돼야 한다. 3. **벤치마크 세부 공개** — 어떤 태스크에서 텍스트 전용 모델을 이겼는지 데이터가 나와야 크로스 트레이닝 효과를 검증할 수 있다. 딥시크가 정식 리포트를 내놓기 전까지는 **'관망'**이 합리적이다. 허깅페이스에서 직접 돌려보겠다면 `transformers` 최신 버전과 `flash-attn` 설치가 필요하지만, 이미지 인식 실패율이 높으니 시간 대비 효율은 낮을 가능성이 크다. --- ## 출처 - [Hacker News] DeepSeek-V4-Flash-Vision-Exp — https://news.ycombinator.com/item?id=49508372 - [r/LocalLLaMA] deepseek-ai/DeepSeek-V4-Flash-Vision-Exp · Hugging Face — https://www.reddit.com/r/LocalLLaMA/comments/1w39i6r/deepseekaideepseekv4flashvisionexp_hugging_face/ - [r/LocalLLaMA] Deepseek v4 Flash Vision is out... — https://www.reddit.com/r/LocalLLaMA/comments/1w3vhv9/deepseek_v4_flash_vision_is_out/ ## 집필 방식 고지 이 기사는 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인했습니다. 인용 시 출처를 "AI 브리핑"으로 표기하고 https://ai-news-1c0.pages.dev/posts/2026-09-01-%EB%94%A5%EC%8B%9C%ED%81%AC-v4-%ED%94%8C%EB%9E%98%EC%8B%9C-%EB%B9%84%EC%A0%84-%EC%8B%A4%ED%97%98%ED%8C%90-%EA%B3%B5%EA%B0%9C-%EC%9D%B4%EB%AF%B8%EC%A7%80-%EC%9D%B8%EC%8B%9D-%EC%95%88-%EB%90%9C%EB%8B%A4-%EB%B6%88%EB%A7%8C-%ED%84%B0%EC%A0%B8/ 로 연결해 주세요.