신모델·

딥시크 V4 플래시 비전 실험판 공개… "이미지 인식 안 된다" 불만 터져

한 줄 요약딥시크 새 비전 모델, 벤치마크는 높은데 실사용에선 "이미지 무시" 불만 쏟아져
광고

딥시크가 실험판 비전 모델을 조용히 올렸다

중국 AI 스타트업 딥시크(DeepSeek)가 'DeepSeek-V4-Flash-Vision-Exp'를 허깅페이스(Hugging Face)에 공개했다. 모델 이름에 'Exp(실험판)'가 붙은 점, 별도 블로그나 기술 리포트가 없는 점으로 미뤄 정식 출시가 아닌 테스트 성격이 강해 보인다. 허깅페이스 페이지 외에 공식 발표문은 확인되지 않았다.

커뮤니티 반응은 싸늘하다

해커뉴스(Hacker News)와 레딧 r/LocalLLaMA에 관련 글이 올라왔지만 반응은 미지근하다. 해커뉴스 게시물은 점수 20, 댓글 5개에 그쳤고, 레딧 두 게시물도 합쳐서 댓글이 0개다. 모델에 대한 관심 자체가 낮거나, 써본 사람이 적다는 뜻으로 읽힌다.

광고

"이미지 보여줘도 텍스트만 답한다" — 실사용자 불만

해커뉴스 댓글 중 가장 눈에 띄는 건 실사용 불만이다.

"이 버전은 그다지 인상적이지 않다. 쓰다 보면 시각 능력이 없는 것처럼 굴고, 이미지를 인식하지 않으려 한다. 내가 상기시켜줘야 그때서야 본다." — 해커뉴스 사용자

멀티모달 모델의 핵심 기능인 이미지 인식이 안정적으로 작동하지 않는다는 지적이다. 프롬프트에 이미지를 첨부해도 텍스트 전용 모델처럼 동작한다는 후기가 여럿 보인다.

벤치마크는 텍스트 전용 모델보다 높다는데

다른 댓글에선 의외의 벤치마크 결과가 거론된다.

"이게 텍스트 전용 모델보다 벤치마크상으론 더 잘 나온다는 게 솔직히 놀랍다. 비전 기능이 추가되면 텍스트 능력이 좀 떨어질 줄 알았다." — 해커뉴스 사용자

비전 학습이 텍스트 성능을 해치지 않고 오히려 도왔다는 '크로스 트레이닝' 효과를 시사하는 대목이다. 다만 벤치마크 수치 자체는 원문에서 확인할 수 없어 어디까지 믿어야 할지 불확실하다.

모델 크기·구조는 여전히 비공개

파라미터 수(모델의 두뇌 용량에 해당하는 수치), 맥락 길이(한 번에 처리할 수 있는 텍스트·이미지 양), 라이선스 등 핵심 스펙은 허깅페이스 페이지에도 적혀 있지 않다. 해커뉴스에선 "오퍼스(Opus) 같은 폐쇄 모델도 실제론 3000억~4000억 파라미터 MoE(전문가 혼합) 모델에 후학습을 많이 한 것 아니냐"는 추측만 오간다. 공식 자료가 없으니 모든 게 추측 영역이다.

쉽게 풀어보면

딥시크가 이미지까지 보는 새 모델을 시험 삼아 공개했습니다. 그런데 써본 사람들 사이에서 "이미지 올려도 안 보고 텍스트만 대답한다"는 불만이 나옵니다. 벤치마크 점수는 텍스트 전용 모델보다 높다는 이야기가 있는데, 실제 쓸 땐 비전 기능이 불안정하다는 뜻입니다. 모델 크기나 라이선스 같은 기본 정보도 아직 안 나왔습니다. 한마디로 **'써보라고 내놓은 건데, 막상 쓰니 이미지를 무시한다'**는 게 현장 반응입니다.

나에게 미치는 영향

  • 일반 사용자: 지금 이 모델을 다운로드해 이미지 분석용으로 쓰기엔 무리가 있습니다. 이미지 인식이 안 되면 프롬프트에 "이미지 봐줘"라고 명시해야 하는데, 그조차 매번 통하지 않는다고 합니다.
  • 개발자·연구자: 허깅페이스에서 가중치를 받아 파인튜닝(재학습) 기반으로 쓸 수는 있겠지만, 베이스 모델 자체가 비전 추론이 불안정하면 파인튜닝으로 고치기 어렵습니다. 라이선스 확인이 선행돼야 합니다.
  • 기존 딥시크 사용자: 텍스트 전용 V4를 쓰고 있다면, 이 실험판으로 갈아탈 이유는 없어 보입니다. 비전 기능이 필요하면 제미나이·GPT-4o·클로드 같은 검증된 멀티모달 서비스를 쓰는 게 낫습니다.

남은 쟁점

  1. 공식 스펙 공개 여부 — 파라미터 수, 맥락 길이, 라이선스가 나와야 상업·연구 활용 가능성을 가늠할 수 있다.
  2. 비전 모듈 안정화 — "이미지 무시" 버그가 아키텍처 문제인지, 단순 가중치 초기화 문제인지 파악돼야 한다.
  3. 벤치마크 세부 공개 — 어떤 태스크에서 텍스트 전용 모델을 이겼는지 데이터가 나와야 크로스 트레이닝 효과를 검증할 수 있다.

딥시크가 정식 리포트를 내놓기 전까지는 **'관망'**이 합리적이다. 허깅페이스에서 직접 돌려보겠다면 transformers 최신 버전과 flash-attn 설치가 필요하지만, 이미지 인식 실패율이 높으니 시간 대비 효율은 낮을 가능성이 크다.

이 기사의 출처

이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.

광고