GPT-6 아스트라, 와우 초보 구역 40분 만에 클리어 — 화면 없이 패킷만 읽고 플레이
화면 없이 패킷만 읽고 40분 만에 깼다
오픈AI가 지난달 초 공개한 플래그십 모델 GPT-6 아스트라가 월드 오브 워크래프트(WoW) 오크 시작 지역 '시련의 골짜기'에서 센진 마을까지 40분 만에 클리어했다. 사망 0회. 렌더링된 화면은 단 한 프레임도 보지 않았다. 대신 서버가 보내는 로우 네트워크 패킷 28종과 퀘스트 데이터가 담긴 SQL 파일을 직접 파싱해 상황을 파악하고 행동했다.
개발자는 오픈소스 클라이언트 'agent-wow'와 단일 프롬프트만으로 이 런을 돌렸다. agent-wow는 블리자드 공식 서버가 아닌 아제로스코어(AzerothCore) 기반 사설 서버와 통신한다. 아제로스코어는 와우 3.3.5a(리치 왕의 분노 최종 빌드)를 구동하는 오픈소스 서버 소프트웨어다. 즉, 이 실험은 라이브 서버가 아닌 로컬 테스트 환경에서 이뤄졌다.
에이전트가 스스로 만든 모듈로 세계를 이해했다
자료에 따르면 아스트라는 직접 파이썬 스크립트를 짜서 서버 메시지를 폴링(polling)하며 월드 상태를 재구성했다. 퀘스트 정보는 팬 사이트 '와우헤드' 대신 서버가 실제 구동에 쓰는 SQL 파일에서 직접 추출했다. 개발자는 이를 "사람이 와우헤드에서 몇 시간 조사하는 것과 비슷하지만, 서버가 쓰는 원본 데이터라 더 정확하다"고 설명했다.
길찾기는 C++ 헬퍼와 디투어(Detour) 라이브러리, 아제로스코어의 내비게이션 메시(mmaps)를 조합해 구현했다. 개발자는 "휴리스틱 봇 연구에서 길찾기가 항상 최대 난제였는데, 아스트라의 경로 탐색은 최적에 가깝다"고 평가했다. 심지어 충돌 판정이 누락된 맵 버그를 자동으로 이용해 지름길을 찾기도 했다고 한다.
계획 능력: 퀘스트 체인·장비 정비·동시 수주까지
단순 이동·전투를 넘어 전략적 판단도 확인됐다. 개발자 기록에 따르면 아스트라는
- 선행 퀘스트 체인을 순서대로 완수
- 잡동사니 판매 후 장비 업그레이드
- 최종 동굴 진입 전 스킬 습득
- 동굴 내 두 퀘스트를 한 번에 수주해 동시 클리어
이러한 흐름을 자율적으로 짜냈다. 과거 포탈 플레이(스크린샷 기반, 24시간 소요)와 달리 시각 입력 없이 프로토콜 레이어만으로 더 복잡한 MMO 환경을 다뤘다는 점이 차이다.
이전 성과와 연결되는 '자율 문제 해결' 패턴
본지가 12일 전 다룬 GPT-6 아스트라, 20년 풀리지 않던 에니그마 암호 해독에서도 이 모델은 외부 도구 호출과 장기 추론을 결합해 미해독 암호를 이틀 만에 풀었다. 당시에도 시각 자료 없이 텍스트·데이터 스트림만으로 가설을 세우고 검증하는 루프를 돌렸는데, 이번 와우 런은 그 패턴이 실시간 인터랙티브 환경으로 확장됐음을 보여준다.
라이브 서버 적용은 아직 — 제약 사항이 명확하다
이 결과를 '와우를 정복했다'로 확대해석해선 안 된다. 몇 가지 전제가 따른다.
- 사설 서버 전용: 공식 블리자드 서버와는 프로토콜·데이터 구조가 다를 수 있다. 라이브 서버 접속 시 차단·제재 위험이 크다.
- 단일 구역만 검증: 1~5레벨 구간이다. 80레벨 만렙까지, 나아가 개발자 목표인 '영웅 난이도 얼음왕관 성채 공략'은 전혀 다른 규모의 장기 기억·협력·전술이 필요하다.
- 비용·속도 미공개: '추론 노력 extra high, 최대 바로 아래 단계'로 돌렸다고만 밝혔다. API 비용과 실시간 응답 지연은 공개되지 않았다.
- 봇 탐지 회피 미고려: 이 실험은 봇 방지 시스템이 없는 환경이다. 실제 서비스에서는 패킷 분석 자체가 탐지 대상이 될 수 있다.
쉽게 풀어보면
GPT-6 아스트라는 오픈AI가 지난달 내놓은 최신 대형 언어 모델입니다. 이번에 개발자 한 명이 이 모델에게 월드 오브 워크래프트(와우)라는 온라인 게임을 하게 했습니다.
보통 게임 AI는 화면을 보고 픽셀을 분석합니다. 그런데 아스트라는 화면을 전혀 보지 않았습니다. 대신 게임 서버가 보내는 **통신 데이터(패킷)**와 **퀘스트 정보가 든 데이터베이스 파일(SQL)**만 읽고 상황을 파악했습니다. 마치 눈이 안 보이는 사람이 무전기와 지도만으로 던전을 탐험하는 것과 비슷합니다.
결과는 놀라웠습니다. 레벨 1 오크로 시작해 초보 구역 전체를 40분 만에 클리어했고, 단 한 번도 죽지 않았습니다. 퀘스트 순서를 스스로 정하고, 아이템을 팔아 장비를 사고, 스킬을 배우고, 동굴 안 퀘스트 두 개를 한꺼번에 받아 같이 깨는 등 계획성 있는 플레이를 보여줬습니다.
다만 이건 블리자드 공식 서버가 아니라 연구용 사설 서버에서 돌린 실험입니다. 실제 게임 서버에는 봇 탐지 시스템이 있고, 프로토콜도 다를 수 있습니다. 아직 '게임 정복'이라기보다 '시각 없이 네트워크 프로토콜만으로 복잡한 환경을 이해하고 행동할 수 있음'을 증명한 단계로 보는 게 정확합니다.
나에게 미치는 영향
일반 게이머나 직장인이 오늘 당장 체감할 변화는 없습니다. 이 실험은 API로 제어 가능한 환경에서 에이전트가 자율적으로 장기 과제를 수행할 수 있는지를 테스트한 연구용 데모에 가깝습니다.
하지만 개발자나 자동화 업무를 고민하는 사람이라면 눈여겨볼 지점이 있습니다.
- 시각 API가 없는 레거시 시스템·내부 툴·산업 장비에서도 패킷·로그·DB만 읽고 에이전트가 상태를 파악해 조작할 수 있다는 가능성
- 브라우저 자동화·RPA 대체로 '화면 스크래핑' 대신 백엔드 API·프로토콜 직접 호출 방식이 더 안정적일 수 있다는 힌트
- 오픈소스 agent-wow 저장소가 공개돼 있으니, 로컬에서 아제로스코어 서버를 띄워 에이전트 실험을 직접 돌려볼 수 있습니다(파이썬·C++ 환경 필요)
챗GPT·클로드·제미나이 같은 일반 채팅 서비스로는 이걸 바로 해볼 수 없습니다. 코덱스(Codex)나 API 접근 권한이 있는 개발 환경에서만 테스트 가능합니다. 관심 있다면 agent-wow 깃허브를 찾아 로컬 서버를 띄워보는 게 첫 단계입니다.
남은 쟁점: 비용·일반화·탐지 회피
개발자 다음 목표는 '단일 에이전트가 80레벨까지 혼자 도달할 수 있는지' 확인하는 겁니다. 거기서 확인돼야 할 것들은
- 장기 기억 관리: 수천 퀘스트·아이템·지식 맥락을 어떻게 압축 유지할지
- 비용 곡선: 40분 런 한 번에 API 비용이 얼마인지(공개 안 됨)
- 일반화: 와우 외 다른 MMO·시뮬레이션·산업 시뮬로 같은 아키텍처가 먹히는지
- 탐지 회피: 실제 서비스 환경에서 패킷 분석 행위 자체가 차단되지 않게 하려면
이 네 가지가 다음 단계 검증 포인트입니다. 본지는 개발자 공개 데이터가 나오는 대로 후속 보도하겠습니다.
이 기사의 출처
- r/OpenAIChatGPT-6 Astra plays World of Warcraft 'blind' and clears the orc starting zone in 40 minutes with no deaths — AI agent navigates by parsing raw server network packets and SQL files
- r/ChatGPTChatGPT-6 Astra plays World of Warcraft 'blind' and clears the orc starting zone in 40 minutes with no deaths — AI agent navigates by parsing raw server network packets and SQL files
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.