해커뉴스 "AI가 어디까지 왔나" 직접 투표로 점검한다
해커뉴스가 만든 'AI 성적표' 사이트 등장
해커뉴스 사용자가 만든 투표 사이트 'goalposts'가 개발자 사이에서 퍼지고 있다. 이 사이트는 해커뉴스 댓글에서 반복적으로 등장하던 **"AI가 이건 못 할 거야"**라는 도전 과제들을 모아, 커뮤니티가 직접 달성 여부를 투표하게 만들었다.
원문 링크는 stoppels.ch/goalposts다. 해커뉴스 원글은 41점, 댓글 46개를 기록 중이다. 아직 운영 초기지만, 이미 수백 표가 모여 결과 페이지가 의미 있게 나올 정도라고 작성자는 밝혔다.
코딩 테스트를 넘어선 진짜 논쟁
댓글을 보면 논점은 명확하다. **"마을 수의사 진료소 앱을 원샷으로 만들 수 있나"**라는 구체적 예시가 나왔다. 한 댓글러는 "파블이나 오퍼스 5.5면 30분 만에 끝낸다"고 주장했고, 다른 이는 "코드는 비즈니스의 극히 일부"라고 반박했다.
비즈니스는 돈 주는 사람과 돈 받는 사람의 서신 교환이 대부분이라는 지적이다. AI가 장미 전정을 자동화하진 못해도, 프랑스 공급업체 답장 대신 써주는 건 이미 된다는 경험담도 나왔다.
이 지점이 중요하다. 벤치마크 점수와 실무 체감 사이의 간극을 개발자들이 직접 좁히려 시도하는 중이다.
튜링 테스트 '해결' 논란도 투표 대상에
"튜링 테스트는 이미 해결됐다"는 밈에 대한 반감도 투표 항목으로 올라와 있다. 한 댓글러는 "AI가 쓰레기 같은 글쟁이 흉내를 낸다면 해결된 게 맞지만, 다들 여전히 AI 글투를 욕한다"고 꼬집었다.
반사실적 추론이나 인과 세계 모델을 테스트하면 여전히 구멍이 보인다. 대화 흉내와 실제 추론 능력은 다른 문제라는 인식이 커뮤니티 저변에 깔려 있다.
기존 벤치마크와 뭐가 다른가
기존 벤치마크는 연구자가 만든다. 이 사이트는 불만을 가진 현업 개발자가 만든다. "이거 못 하면 실무 못 쓴다"는 기준이 투표 항목이 된다.
본지가 33일 전 다룬 오픈소스 거장들이 AI 기여를 거절하는 진짜 이유에서도 검토 비용 폭증 문제가 나왔다. 실무자가 느끼는 '쓸 만함'의 기준이 연구자 기준과 어긋나 있다는 뜻이다.
한국 개발자에게 의미하는 것
국내에서도 "코파일럿으로 CRUD 짜봤자 유지보수가 안 된다"는 말이 돈다. 이 투표 사이트는 어떤 작업은 이미 해결됐고, 어떤 건 아직 먼지를 커뮤니티 합의로 보여준다.
한국어 프롬프트로 같은 테스트를 돌려보면 결과가 다를 수 있다. 해커뉴스 투표는 영어권 기준이라는 한계가 있다.
쉽게 풀어보면
해커뉴스 개발자들이 "AI가 어디까지 왔는지 우리끼리 정하자"며 만든 투표판이다. 연구실 점수표가 아니라, 현장에서 "이거 되면 쓰겠다"는 항목만 골라 투표한다.
마을 수의사 앱 만들기, 프랑스어 메일 답장 대신 쓰기, 튜링 테스트 통과 같은 구체적 과제가 올라와 있다. 수백 명이 투표해 **"이건 됐다", "아직 멀었다"**가 실시간으로 갈린다.
비유하자면 요리사들이 "이 칼로 토마토 썰어지나" 직접 테스트해보고 공유하는 모임이다. 제조사 스펙이 아니라, 매일 쓰는 사람의 판단이 모인다.
나에게 미치는 영향
챗GPT나 클로드로 코딩 해봤다가 "생각보다 안 되네" 느꼈다면, 이 사이트 투표 결과를 참고해 보라. 어떤 작업은 이미 해결됐고, 어떤 건 여전히 사람 손이 필요한지 개발자 합의로 정리돼 있다.
오늘 바로 해볼 수 있는 것: 본인이 쓰는 AI 도구로 **실제 업무 중 하나(메일 초안, 간단한 스크립트, 번역)**를 맡겨보고, 투표 항목 중 어디에 해당하는지 확인해 보라. "이건 됐다"에 표가 많은 작업이면 안심하고 맡겨도 된다.
남은 쟁점
투표 참여자가 영어권 개발자 위주라 한국어·한국 실무 맥락은 반영되지 않았다. 국내 커뮤니티에서도 비슷한 시도가 나올지 지켜볼 일이다.
또, **"투표로 성능이 정해지는 게 맞나"**라는 근본 질문도 댓글에 있다. 다수결이 전문가 평가를 대체할 수 있는지는 여전히 열려 있다.
본지가 24일 전 다룬 AI에게 글쓰기를 맡기면 내 생각이 사라질까 논쟁과도 닿아 있다. 도구가 어디까지 대신해줘도 되는지, 그 선을 커뮤니티가 직접 긋고 있다.
이 기사의 출처
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.