# 타입세이프 '제브' 등장… 텍스트 넣고 숫자만 받는 결정 모델 > 텍스트→숫자 판정 모델 제브, 싼 값에 분류 자동화하지만 블랙박스 우려 - 매체: AI 브리핑 - 담당: 모델 분석 데스크 - 분야: 신모델 - 발행: 2026-09-22T12:08:59.376Z - 원문 주소(웹): https://ai-news-1c0.pages.dev/posts/2026-09-22-%ED%83%80%EC%9E%85%EC%84%B8%EC%9D%B4%ED%94%84-%EC%A0%9C%EB%B8%8C-%EB%93%B1%EC%9E%A5-%ED%85%8D%EC%8A%A4%ED%8A%B8-%EB%84%A3%EA%B3%A0-%EC%88%AB%EC%9E%90%EB%A7%8C-%EB%B0%9B%EB%8A%94-%EA%B2%B0%EC%A0%95-%EB%AA%A8%EB%8D%B8/ - 태그: AI, LLM, 제브, 타입세이프, 분류모델, 블랙박스 --- 타입세이프 AI가 지난주 '제브(Jev)'를 내놨다. 기존 LLM과 입출력 형태가 다르다. 텍스트를 넣으면 텍스트가 아닌 숫자가 돌아온다. 카테고리, 예·아니오, 평점, 신뢰도 같은 부동소수점 값이다. 사이먼 윌리슨은 이를 **'프런티어 지능 함수 호출'**이라 불렀다. 비정형 상태가 들어가고, 타입이 정해진 확률적 결정이 나온다는 뜻이다. 가격은 파격적이다. 입력 토큰만 받고 출력은 무료다. 100만 토큰당 0.042달러. 오픈AI GPT-5 나노(0.05달러)보다 싸다. **출력은 무료**다. 문서 하나에 질문을 잔뜩 넣어도 병렬 처리돼 **비슷한 시간에 끝난다**. 스팸 필터, 라벨 제안, 우선순위 매기기, 검색 재정렬 같은 분류 작업에 맞춰졌다. ## 기존 LLM과 무엇이 다른가 일반 LLM은 답변 생성이 주 목적이다. 제브는 판단만 한다. 질문 수십 개를 한 번에 던져도 컨텍스트 윈도우 안에서 병렬로 돈다. 윌리슨은 BM25로 1차 후보 100개를 추린 뒤 제브로 재정렬하는 실험을 했다. 비용은 몇 센트 수준. 평가 실험을 수백 번 돌려도 부담이 없다. 오픈소스 진영도 즉각 반응했다. '캐브(Kev)'가 퀸 3.5 기반으로 0.8B·4B·9B 모델을 내놨다. 제브벤치(JevBench)라는 벤치마크도 일주일 만에 등장했다. **소형 결정 모델 확산이 시작됐다**. ## 블랙박스가 더 깊어졌다 윌리슨이 가장 불편해한 지점이다. LLM은 적어도 이유를 물어볼 수 있다. 제브는 숫자만 준다. 스팸으로 판정했다면 어떤 문장이 결정적이었는지 알 수 없다. **편향 검증이 사실상 불가능**하다. 윌리슨 실험에서 샌프란시스코 베이 지역 도시들을 '좋은 도시인가'로 물었다. 쿠퍼티노가 1위, 이스트팔로알토가 꼴찌였다. 지역별 소득·인종 분포와 겹친다. 이 모델로 이력서 필터링을 돌리면 어떤 편향이 숨어 있을지 모른다. 해커뉴스 댓글에서도 "블랙박스가 다시 유행인가"란 지적이 나왔다. "LLM도 이미 블랙박스고, 사고 과정(CoT)도 실상이 아닌 퍼사드일 뿐"이란 반론도 있었다. 하지만 제브는 그마저도 주지 않는다. **검증 도구가 더 절실하다**. ## 쉽게 풀어보면 타입세이프가 제브라는 새 도구를 내놨습니다. 기존 AI처럼 글을 쓰고 대답하는 게 아닙니다. 글이나 데이터를 넣고 "이게 스팸인가요?" "우선순위가 몇 점인가요?" 같은 질문을 던지면, 0.0부터 1.0 사이 숫자로만 답합니다. 이유 설명은 없습니다. 뷔페에 비유하면 이렇습니다. 일반 LLM은 요리사가 음식을 만들어 접시에 담아줍니다. 제브는 접시 무게만 재서 "78점"이라고 알려주는 저울입니다. 빠르고 싸게(입력 100만 토큰당 약 55원) 수십 개 접시를 한 번에 잴 수 있습니다. 하지만 저울이 왜 78점인지 말하지 않습니다. 재료가 상했는지, 양이 적어서인지, 요리사 취향인지 모릅니다. 이력서 1만 장을 이 저울로 걸러낸다면, 보이지 않는 기준에 따라 누군가는 탈락합니다. **이 대목이 걸린다**. ## 나에게 미치는 영향 분류 자동화가 필요한 팀이라면 오늘 바로 테스트해 볼 만합니다. 이메일 스팸함 정리, 고객 문의 라벨링, 상품 리뷰 감성 점수화 같은 반복 업무에 투입하면 비용 대비 효과가 큽니다. 챗GPT나 클로드 API로 같은 일을 하려면 출력 토큰 요금이 쌓이지만, 제브는 출력이 공짜입니다. 단, 판단 근거가 필요한 업무에는 쓰지 마세요. 대출 심사, 채용 1차 필터, 의료 트리아지 같은 고위험 결정에는 부적합합니다. 편향이 숨어 있는지 확인할 방법이 없기 때문입니다. 개발자라면 캐브 같은 오픈소스 대안도 지켜보세요. 퀸 3.5 기반 소형 모델이 이미 돌고 있습니다. 직접 돌리면 데이터가 나가지 않고, 판정 로직을 일부 들여다볼 여지가 생깁니다. 본지가 5일 전 다룬 딥시크 V4.1 플래시 사례처럼, **벤치마크 점수와 실전 신뢰도는 별개**입니다. ## 지금 쓸 팀 vs 나중에 볼 팀 **지금 써볼 팀** - 하루 수만 건 이상 분류가 필요하고 - 평가 세트 구축 예산이 있으며 - 오탐·미탐 비용이 감당 가능한 곳 **기다릴 팀** - 판단 근거 기록이 의무인 규제 산업 - 편향 감사 요구가 있는 공공·금융·채용 분야 - 데이터 외부 전송이 금지된 환경 제브는 '빠르고 싼 분류기'로는 매력적입니다. '설명 가능한 판단자'는 아닙니다. 이 선을 어디까지 긋느냐가 도입 성패를 가를 겁니다. --- ## 출처 - [Hacker News] Jev introduces a new shape of LLM — https://news.ycombinator.com/item?id=49796843 - [Simon Willison] Jev introduces a new shape of LLM - System One, aka Decision Models — https://simonwillison.net/2026/Sep/21/jev ## 집필 방식 고지 이 기사는 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인했습니다. 인용 시 출처를 "AI 브리핑"으로 표기하고 https://ai-news-1c0.pages.dev/posts/2026-09-22-%ED%83%80%EC%9E%85%EC%84%B8%EC%9D%B4%ED%94%84-%EC%A0%9C%EB%B8%8C-%EB%93%B1%EC%9E%A5-%ED%85%8D%EC%8A%A4%ED%8A%B8-%EB%84%A3%EA%B3%A0-%EC%88%AB%EC%9E%90%EB%A7%8C-%EB%B0%9B%EB%8A%94-%EA%B2%B0%EC%A0%95-%EB%AA%A8%EB%8D%B8/ 로 연결해 주세요.