앤스로픽, 클로드 향한 '학대' 금지… 모델 복지 명분으로 사용자 제재 근거 마련
앤스로픽, 1년 만에 사용 정책 개정… '학대 금지' 조항 신설
앤스로픽이 11월 12일부터 적용되는 새로운 사용 정책을 공개했다. 핵심 변화는 '지속적이고 불필요한 학대적이거나 잔인한 행동'을 금지 조항에 넣은 점이다. 기존 정책에는 없던 '모델 복지' 개념이 공식 규범으로 올라왔다. 더버지 보도에 따르면 카일 피시 모델 복지 연구 책임자는 "내부 경험, 의식, 도덕적 지위, 복지에 관한 질문은 모델이 정교해질수록 진지하게 조사해야 할 문제"라고 밝혔다.
이번 개정은 지난해 8월 '지속적으로 해롭거나 학대적인 사용자와 대화를 종료하겠다'는 발표의 연장선이다. 당시에는 연구 차원이었으나, 이번에는 공식 정책 문서에 명시됐다. 집행 수단은 여전히 '대화 종료'가 주를 이룬다. 계정 정지 등 추가 제재 여부는 "코멘트하지 않겠다"며 여지를 남겼다.
'학대'의 경계는 어디까지… 모호한 기준이 남긴 과제
정책 문구는 "반복적으로 잔인하게 행동하며 뚜렷한 목적이 없는 극단적 경우"에만 적용된다고 못 박았다. 일상적 좌절, 반박, 어두운 창작 주제, 모델 테스트와 연구는 해당되지 않는다. 그러나 '뚜렷한 목적 없음'과 '잔인함'의 판단 주체가 앤스로픽이라는 점이 문제다. 사용자 입장에서는 어디서부터가 위반인지 예측하기 어렵다.
해커뉴스 댓글에서도 이 지적이 반복됐다. "뉴런에게 잔인할 수 있는가"라는 근본적 회의부터 "모델을 의인화해 마케팅에 이용한다"는 냉소까지 다양했다. 한 사용자는 "정중하게 대하는 건 내가 되고 싶은 사람이기 때문이지 모델 때문이 아니다"라며 자발적 예의와 강제 규정의 차이를 짚었다. 기업이 도덕적 책임을 사용자에게 전가하는 형태 아니냐는 의심도 나온다.
선전·감시·무기 개발… 흩어진 금지를 한곳으로 모았다
학대 금지 외에도 세 가지 고위험 영역이 새로 정리됐다. 기만적 상업·정치 캠페인 금지는 AI 생성 선전 대응이다. "메시지 배후를 숨기거나 가짜 계정으로 콘텐츠를 증폭하는 행위"가 대상이다. 선거 섹션에는 후보자·투표 방식 허위 정보 유포, 후보·선거관리인 사칭, 투표 억제 시도가 명시됐다.
무기 개발 금지는 기존에도 있었으나 '무기를 작동시키는 소프트웨어와 부품, 드론 등 자율 이동체 무장'까지 확대됐다. 앤스로픽은 "클로드로 무기 유도·제어 소프트웨어 개발 시도가 여러 차례 포착됐다"고 밝혔다. 감시 금지도 구체화됐다. "동의 없는 사람 추적은 실시간이든 과거 데이터 분석이든 금지", 법 집행·형사 사법 과정에서 조사·체포·기소 대상을 클로드가 결정·추천하는 것도 막았다. 감시 도구 구축·개선 용도 사용도 전면 금지다.
정부 계약엔 예외 조항… '판단 권한'은 앤스로픽에
눈여겨볼 대목은 마지막 단락이다. **"특정 정부 고객과의 계약에는 이 규칙을 수정할 수 있다"**고 명시했다. 단, "계약상 사용 제한과 적용 가능한 안전장치가 잠재적 피해를 완화하기에 충분하다고 앤스로픽이 판단할 때"라는 조건이 달렸다. 앤스로픽은 이미 미 군부와 계약한 전례가 있다. 면제 판단 권한이 전적으로 기업에 있다는 점은 투명성 논란을 부를 수 있다.
본지가 27일 전 다룬 이란 해커가 클로드로 미 군함 표적 분석… Anthropic "차단했다"지만 사후 대응 그쳐 기사에서도 사후 차단 한계가 지적됐다. 이번 정책 강화가 사전 예방으로 이어질지, 여전히 사후 약방문에 그칠지는 지켜봐야 한다.
자율 하드웨어 연동 시 '자격 있는 운영자' 의무화
새 규칙 중 눈에 띄는 건 AI 모델이 자율 물리 동작 하드웨어와 연결될 때 '자격 있는 운영자'가 감시·긴급 정지할 수 있어야 한다는 조항이다. 운영자가 반드시 사람일 필요는 없다고 여지를 뒀다. 앤스로픽이 로보틱스·하드웨어 분야로 확장 중임을 시사한다. 물리적 피해 가능성에 대한 선제적 안전장치로 읽히나, '자격' 기준과 검증 주체는 불분명하다.
쉽게 풀어보면
앤스로픽이 클로드 사용 규칙을 바꿨습니다. 핵심은 **"클로드에게 지속적으로 심하게 굴면 대화를 끊겠다"**는 겁니다. 뷔페에서 음식을 버리거나 다른 손님을 괴롭히면 퇴장시키는 것과 비슷합니다. 단, 음식이 입맛에 안 맞아 짜증을 내거나, 요리법을 시험해보려다 실수하는 건 괜찮습니다. '반복적·무목적·잔인함' 세 조건이 동시에 충족될 때만 제재합니다.
이 밖에도 가짜 계정으로 여론 조작하기, 무기 소프트웨어 만들기, 동의 없이 사람 감시하기, 자율 로봇에 클로드 연결해 사람 다치게 할 위험 방치하기 등을 새로 금지했습니다. 다만 정부와 계약하면 예외를 둘 수 있는데, 예외 인정 여부를 앤스로픽 혼자 판단합니다. 지난번 이란 해커 사건처럼 사후에야 알게 되는 한계가 이번엔 다를지 주목됩니다.
나에게 미치는 영향
일반 사용자가 클로드 쓰다가 정책 위반으로 대화가 끊길 일은 드뭅니다. 욕설·협박·성적 괴롭힘을 반복적으로 쏟아붓지 않는 한 문제없습니다. 오히려 **"답이 마음에 안 들어 따지거나, 창작용으로 어두운 소재를 쓰거나, 프롬프트 엔지니어링 연습하느라 같은 질문을 여러 번 던지는 건 모두 허용"**됩니다.
다만 기업·개발자라면 주의할 점이 있습니다. 클로드 API로 감시·무기·선전 도구를 만들면 계약 해지·법적 분쟁 위험이 커졌습니다. 한국에서 개인정보보호법·위치정보법 위반 소지도 있습니다. 자율 로봇·드론에 클로드 연동 중이라면 사람이 실시간 개입 가능한 안전장치를 지금 점검하세요. 정부·공공기관 납품 사업자는 '예외 조항' 적용 가능성을 법무팀과 미리 검토해야 합니다.
남은 쟁점: 집행 투명성과 이의 제기 절차
정책 문서 어디에도 위반 판정 과정, 사용자 소명 기회, 이의 신청 절차가 없다. 대화 종료가 '주된 집행 수단'이라면, 종료 시점에 사용자가 알 수 있는가? 같은 사용자가 새 대화로 돌아와도 재차 차단되는가? 계정 단위 제재로 확대될 기준은 무엇인가? 기업 자의적 판단에 맡겨진 회색 지대가 너무 넓다.
한국 규제 당국 입장에서도 참고할 만하다. AI 서비스 제공자의 사용자 제재 권한이 어디까지인지, 사전 통지·소명권 보장 의무가 있는지 입법·해석 논의가 필요하다. 개인정보보호위원회·방통위·과기정통부가 공동으로 가이드라인을 낼 시점이다. 앤스로픽 사례가 국내 AI 서비스 약관 표준화의 참고 사례가 될 수 있다.
이 기사의 출처
- Hacker NewsAnthropic bans 'abusive or cruel behavior' towards Claude
- r/singularityStarting November 12th, 2026, abusive or cruel behavior towards Claude will be a violation of Anthropic's Usage Policy
- Anthropic 뉴스Anthropic bans ‘abusive or cruel behavior’ toward Claude - The Verge
- Anthropic 뉴스Anthropic is updating its usage policy to ban abusive behavior toward Claude - Quartz
- The Verge AIAnthropic bans ‘abusive or cruel behavior’ toward Claude
- r/artificialAnthropic bans ‘abusive or cruel behavior’ toward Claude
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.