신모델·

GPT-6 아스트라가 와우를 한다? 취소된 모델이 코덱스에서 돌아간 사연

한 줄 요약출시 취소된 GPT-6 아스트라가 코덱스에서 와우를 플레이한 이유, 에이전트-와우 실험의 의미
광고

개발자 한 명이 만든 '에이전트-와우(agent-wow)'라는 플랫폼에 GPT-6 아스트라가 들어갔다. 오크 캐릭터를 생성해 시작 지역 퀘스트를 전부 깨는 데 40분, 사망 0회. 영상도 공개됐다.

와우를 '시뮬레이션 월드'로 쓰는 이유

와우 클래식부터 리치 왕의 분노(3.3.5a)까지는 장기 전략과 단기 전술이 균형을 이룬다. 장비 맞춤→제작→자원 수급→골드 구매 중 선택, 레이드에선 24명과 실시간 협업하며 화염 피하고 최적 스킬 순환. 이 모든 게 에이전트에게 '장기 계획·좁은 전술 실행·멀티플레이어 협업'을 한꺼번에 테스트하는 환경이 된다.

에이전트-와우는 화면 인식·키보드 마우스 조작이 아니다. 와우 네트워크 프로토콜로 게임 서버와 직접 통신한다. 이동·전투·상호작용 같은 게임 메커닉을 아예 정의하지 않고, 에이전트가 스스로 모듈을 짜서 능력을 확장하는 방식이다. 마인크래프트의 마인플레이어 API 방식과 같다.

취소된 모델이 왜 코덱스에 있나

여기서 의문이 생긴다. 본지가 3일 전 전한 대로 오픈AI가 GPT-6.1 솔을 공개하며 아스트라를 안전 우려로 취소했다면, 코덱스(Codex)에서 'GPT-6 아스트라(xhigh)'가 어떻게 돌아가는 걸까.

가능성은 둘이다. 하나는 오픈AI가 내부·파트너용으로 아스트라 빌드를 남겨뒀고 코덱스가 그걸 쓰는 경우. 다른 하나는 '아스트라'라는 이름이 붙은 별도 체크포인트·파인튜닝 버전이 코덱스 전용으로 존재하는 경우. 어느 쪽이든 공식 출시 모델은 아니다. 28일 전 보도에서 오픈라우터에 올라온 '아스트라'도 접근성·가격·검증 모두 불투명하다고 짚었듯, 이름이 같아도 실체가 다를 수 있다.

광고

에이전트-와우가 기존 봇과 다른 점

휴리스틱 봇은 '이 상황이면 이 행동'을 사람이 미리 짠다. LLM 에이전트는 게임을 전혀 학습하지 않은 상태에서 추론만으로 행동한다. 영상 보면 퀘스트 NPC 찾기→이동→대화→몹 사냥→전리품 획득→다음 퀘스트 수락까지 막힘없이 이어간다. 1만6천 줄짜리 이동 프리미티브를 짜다 버리고 모듈 시스템으로 바꾼 개발자 말대로, 에이전트가 직접 도구를 만드는 피드백 루프가 핵심이다.

한국 이용자가 지금 확인할 수 있는 것

한국에서 와우 클래식·리치 왕의 분노를 정식으로 하려면 블리자드 한국 서버를 써야 한다. 에이전트-와우는 아제로스코어(AzerothCore)라는 오픈소스 에뮬레이터로 로컬 서버에서만 돈다. 정식 서버 접속이 아니고, 약관 위반 소지도 있다. 그냥 'AI가 이 정도 한다'는 참고용으로만 보면 된다.

코덱스 사용자라면 설정에서 모델을 'GPT-6 아스트라(xhigh)'로 두고 비슷한 프롬프트를 넣어볼 수 있다. 단, 이 모델이 뭘 기반으로 하는지 오픈AI가 밝힌 적 없다. 본지가 29일 전 다룬 커뮤니티 회의적 반응 그대로, 검증 없이 이름만 믿고 쓰면 안 된다.

해커뉴스 반응에서 보이는 두 가지 시선

댓글 54개 중 눈에 띄는 건 두 갈래다. "아제로스코어 덕분에 로컬에서 직업 다 배우고 순간이동 쓰며 재밌게 한다"는 플레이어 층과, "기존 봇으로 99% 자동화되던 거 남은 1%에 LLM 쓰는 게 맞나"는 회의론. 마이크로소프트 베가(VEGA) 프로젝트 링크도 올라왔는데, '직접 조작 대신 목표만 주면 알아서 살아가는 에이전트'라는 방향은 같다.

아직 확인 안 된 것들

  • 코덱스의 'GPT-6 아스트라(xhigh)'가 정확히 어떤 체크포인트인지
  • 에이전트-와우가 멀티 에이전트 레이드(25명 아이스왕관 성채 영웅)까지 갈 수 있는지
  • 오픈AI가 아스트라 관련 빌드를 외부 파트너에게 어디까지 제공했는지

자료엔 없다. 확인되면 후속으로 전하겠다.

쉽게 풀어보면

한 개발자가 **'에이전트-와우'**라는 도구를 만들었다. AI가 와우 서버와 직접 대화하며 게임을 하게 해주는 플랫폼이다. 화면을 보고 마우스를 움직이는 게 아니라, 서버 패킷을 주고받으며 퀘스트를 받고 몹을 잡고 아이템을 챙긴다.

이 개발자가 **코덱스(Codex)**라는 코딩 에이전트 도구에 **GPT-6 아스트라(xhigh)**라는 모델을 넣고 "오크 만들어서 시작 지역 퀘스트 다 깨줘"라고 시켰다. 40분 만에 죽지도 않고 끝냈다. 영상도 있다.

그런데 GPT-6 아스트라는 3일 전 오픈AI가 '안전 문제로 출시 취소'했다고 발표한 모델이다. 그럼 왜 코덱스에서 돌아가나? 내부 테스트용 빌드가 남았거나, 이름만 같은 별도 버전일 가능성이 크다. 공식 모델은 아니다.

에이전트-와우의 핵심은 **'미리 짜둔 행동 규칙이 없다'**는 점. 기존 봇은 '퀘스트 뜨면 NPC 쪽으로 이동' 같은 걸 사람이 다 프로그래밍한다. 이 에이전트는 와우를 전혀 모른 채 추론만으로 NPC 찾고, 이동 경로 짜고, 전투하고, 다음 할 일 결정한다. 심지어 필요한 도구(이동·전투·채팅 모듈)도 자기가 코드로 짜서 쓴다.

아제로스코어라는 오픈소스 에뮬레이터로 로컬 서버에서만 돈다. 한국 정식 와우 서버에서 이걸 쓰면 약관 위반이다. 그냥 'AI가 게임 월드에서 이만큼 자율적으로 움직인다'는 데모로 보면 된다.

나에게 미치는 영향

코덱스 구독자라면 지금 설정에서 모델을 'GPT-6 아스트라(xhigh)'로 바꿔 비슷한 프롬프트를 넣어볼 수 있다. 하지만 이 모델 정체가 불분명하다. 중요한 코드 작성·리뷰에 쓰기엔 위험하다. 검증된 GPT-6.1 솔이나 클로드 4 오퍼스 쪽이 안전하다.

일반 게이머·직장인이라면 당장 할 건 없다. 로컬 서버 띄우고 에이전트-와우 돌리는 건 개발자 영역이다. 다만 **'게임이 AI 평가장이 되고 있다'**는 흐름은 기억해둘 만하다. 마인크래프트·팩토리오·와우 같은 시뮬레이션에서 에이전트가 장기 계획·실시간 협업까지 어디까지 가는지 보는 게 새 벤치마크가 되고 있다.

AI 에이전트 도입을 고민하는 팀이라면 에이전트-와우의 '모듈 시스템' 설계를 참고해볼 만하다. 에이전트에게 모든 프리미티브를 미리 주려 하지 말고, 필요할 때 스스로 도구를 만들게 하고 자주 쓰는 모듈만 코어로 올리는 방식이 확장성에서 유리하다.

남은 건 검증이다. 아스트라란 이름이 붙었다고 해서 오픈AI 공식 모델 성능이 나오는 건 아니다. 코덱스에서 어떤 모델을 쓸지, 그 모델이 어디서 왔는지 한 번 더 확인하고 쓰는 습관이 지금으로선 최선이다.

이 기사의 출처

이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.

광고