클라우드플레어, 텍스트 대신 확률로 답하는 결정 모델 클레프 공개
클라우드플레어가 내놓은 새로운 종류의 모델
클라우드플레어 워커스 AI 팀이 첫 자체 훈련 모델로 **클레프(Clef)**와 **클레프-플래시(Clef-flash)**를 공개했다. 이 모델들은 챗봇이 아니다. 입력 상태와 질문 스키마를 받아 허용된 각 답변의 확률을 반환한다. 자유 텍스트 생성도, 출력 파싱도 필요 없다. 두 모델 모두 아파치 2.0 라이선스로 가중치가 열려 있으며, 타입세이프 AI의 제브(Jev) API와 호환된다.
클레프는 큐웬3.8-27B를, 클레프-플래시는 큐웬3.5-9B를 백본으로 쓴다. 둘 다 비전 인코더를 유지해 이미지와 비디오 입력을 받는다. 추론은 두 단계다. 백본이 상태와 질문을 한 번의 프리필 패스로 처리하면, 작은 트랜스포머인 '조인트 스키마 헤드'가 최종 은닉 상태를 읽고 각 질문에 증거를 라우팅해 모든 옵션을 공동으로 채점한다. 소프트맥스로 로짓을 확률로 바꾼다.
공급자 벤치마크와 독립 검증의 간극
클라우드플레어 내부 디시전 인덱스 0.2.1 10개 벤치마크 중 7개에서 클레프가 1위를 기록했다. 하지만 제브가 **GPQA 다이아몬드(78.3 대 48.0), MMLU-프로(82.7 대 65.9), BBH(92.9 대 73.7)**에서 명확히 앞선다. 타입세이프 자체 워크플로 평가에선 클레프가 4개 중 3개 영역에서 근소하게 이겼다. 송장 처리 64.7 대 61.8, 고객 서비스 76.3 대 76.0, 보안 인시던트 62.9 대 61.7. 에이전트 트레이스 관측성은 제브가 71.6 대 68.5로 앞선다.
모든 수치는 공급자 발표이며 독립 재현은 아직 없다. 클라우드플레어 위협 인텔리전스 워크플로에서 도메인 분류 2.2초, gpt-oss-120b 4.7초라는 속도 비교도 같은 범주에 속한다. 이 대목이 걸린다. 실제 운영 환경에서 네트워크 지연, 동시 요청, 콜드 스타트가 개입하면 격차는 달라질 수 있다.
배포 경로와 숨은 비용
워커스 AI 바인딩(env.AI.run()), REST API, AI 게이트웨이로 바로 호출 가능하다. 셀프호스팅은 H200 단일 GPU에서 BF16 가중치로 테스트됐다고 모델 카드에 적혀 있다. 가격 정보는 아직 공개되지 않았다. 워커스 AI 사용량 요금제와 AI 게이트웨이 로그 저장 비용이 별도로 붙을 가능성이 크다.
클라우드플레어는 클레프를 비공개 데이터로 튜닝하는 강화학습 서비스도 발표했다. 포워드 디플로이드 엔지니어부터 시작해 셀프서브 플랫폼으로 확대한다. 파이프라인은 AI 게이트웨이, 워커스 AI, 컨테이너, 새 트레이너 컴포넌트를 엮는다. 디자인 파트너 신청 폼으로 참여 가능하다.
쉽게 풀어보면
클라우드플레어가 **'대답을 골라주는 모델'**을 내놨다. 평소 쓰는 챗GPT나 클로드는 질문을 받으면 문장을 이어 쓴다. 개발자는 그 문장에서 정답을 뽑으려 정규식이나 JSON 파서를 쓴다. 클레프는 다르다. '이 이미지가 개인가 고양이인가' 같은 질문을 스키마로 넘기면, '개 0.87, 고양이 0.13'처럼 확률을 바로 돌려준다. 파싱 코드가 필요 없다.
뷔페에 비유하면 이렇다. 일반 LLM은 요리사가 즉석에서 접시에 음식을 담아준다. 클레프는 메뉴판과 재료표를 보여주고 '이 재료로 만들 수 있는 요리 확률'을 계산해 준다. 메뉴가 정해져 있을 때, 즉 분류·라우팅·정보 추출 같은 작업에서 텍스트 생성보다 빠르고 예측 가능하다.
한 요청에 최대 64개 질문, 이미지 4장까지 넣을 수 있다. 워커스 AI에서 오늘 바로 써볼 수 있고, 허깅페이스에서 가중치를 내려받아 내 서버(H200급 GPU 필요)에서도 돌릴 수 있다.
나에게 미치는 영향
지금 바로 확인해 볼 것: 클라우드플레어 계정이 있다면 워커스 AI 플레이그라운드에서 Cloudflare/clef를 선택해 이미지 분류 스키마를 던져 보라. 확률 출력이 얼마나 직관적인지 체감할 수 있다.
개발자라면: 기존 LLM + 파서 조합을 클레프로 대체했을 때 코드량이 얼마나 줄는지 테스트해 보라. 특히 **고정 스키마가 있는 반복 작업(로그 분류, 티켓 라우팅, 폼 추출)**에서 효과가 클 것으로 보인다.
운영 담당자라면: 워커스 AI 요금제와 AI 게이트웨이 로그 비용을 계산기에 넣어 보라. 셀프호스팅은 H200 1대(약 3만 달러급)가 기준이라 소규모 팀엔 진입 장벽이 있다.
기다려도 되는 쪽: 범용 추론·코딩·창작이 주 용도라면 여전히 챗GPT·클로드·제미나이가 낫다. 클레프는 '결정'에 특화돼 있어 자유 대화엔 쓰지 못한다.
남은 검증 과제
독립 벤치마크가 없다. 클라우드플레어와 타입세이프 양쪽 숫자만 있다. 실제 프로덕션 트래픽에서 지연 분포, 처리량, 에러율이 어떻게 나오는지가 다음 분기 커뮤니티 리뷰에서 드러날 것이다. 강화학습 튜닝 서비스의 가격·SLA·데이터 격리 정책도 미공개다. 이 두 가지가 확정돼야 '도입 여부'를 판단할 수 있다.
이 기사의 출처
- MarkTechPostCloudflare Releases Clef and Clef-flash: Open-Weight Decision Models That Return Typed Probabilities Instead of Text
- r/LocalLLaMAClef: Open Weights decision model by Cloudflare
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.