# 해커뉴스 "AI가 어디까지 왔나" 직접 투표로 점검한다 > 개발자 커뮤니티가 만든 AI 성능 투표 사이트, 코딩 넘어 실무 능력까지 검증한다 - 매체: AI 브리핑 - 담당: 이슈 데스크 - 분야: 논쟁 - 발행: 2026-10-01T20:02:50.522Z - 원문 주소(웹): https://ai-news-1c0.pages.dev/posts/2026-10-02-%ED%95%B4%EC%BB%A4%EB%89%B4%EC%8A%A4-ai%EA%B0%80-%EC%96%B4%EB%94%94%EA%B9%8C%EC%A7%80-%EC%99%94%EB%82%98-%EC%A7%81%EC%A0%91-%ED%88%AC%ED%91%9C%EB%A1%9C-%EC%A0%90%EA%B2%80%ED%95%9C%EB%8B%A4/ - 태그: AI 평가, 해커뉴스, 벤치마크, 코딩, 실무 활용 --- ## 해커뉴스가 만든 'AI 성적표' 사이트 등장 해커뉴스 사용자가 만든 투표 사이트 'goalposts'가 개발자 사이에서 퍼지고 있다. 이 사이트는 해커뉴스 댓글에서 반복적으로 등장하던 **"AI가 이건 못 할 거야"**라는 도전 과제들을 모아, 커뮤니티가 직접 달성 여부를 투표하게 만들었다. 원문 링크는 stoppels.ch/goalposts다. 해커뉴스 원글은 41점, 댓글 46개를 기록 중이다. 아직 운영 초기지만, 이미 수백 표가 모여 결과 페이지가 의미 있게 나올 정도라고 작성자는 밝혔다. ## 코딩 테스트를 넘어선 진짜 논쟁 댓글을 보면 논점은 명확하다. **"마을 수의사 진료소 앱을 원샷으로 만들 수 있나"**라는 구체적 예시가 나왔다. 한 댓글러는 "파블이나 오퍼스 5.5면 30분 만에 끝낸다"고 주장했고, 다른 이는 "코드는 비즈니스의 극히 일부"라고 반박했다. **비즈니스는 돈 주는 사람과 돈 받는 사람의 서신 교환이 대부분**이라는 지적이다. AI가 장미 전정을 자동화하진 못해도, 프랑스 공급업체 답장 대신 써주는 건 이미 된다는 경험담도 나왔다. 이 지점이 중요하다. 벤치마크 점수와 실무 체감 사이의 간극을 개발자들이 직접 좁히려 시도하는 중이다. ## 튜링 테스트 '해결' 논란도 투표 대상에 "튜링 테스트는 이미 해결됐다"는 밈에 대한 반감도 투표 항목으로 올라와 있다. 한 댓글러는 "AI가 쓰레기 같은 글쟁이 흉내를 낸다면 해결된 게 맞지만, 다들 여전히 AI 글투를 욕한다"고 꼬집었다. 반사실적 추론이나 인과 세계 모델을 테스트하면 여전히 구멍이 보인다. **대화 흉내와 실제 추론 능력은 다른 문제**라는 인식이 커뮤니티 저변에 깔려 있다. ## 기존 벤치마크와 뭐가 다른가 기존 벤치마크는 연구자가 만든다. 이 사이트는 **불만을 가진 현업 개발자가 만든다**. "이거 못 하면 실무 못 쓴다"는 기준이 투표 항목이 된다. 본지가 33일 전 다룬 [오픈소스 거장들이 AI 기여를 거절하는 진짜 이유](/posts/2026-08-30-오픈소스-거장들이-ai-기여를-거절하는-진짜-이유/)에서도 검토 비용 폭증 문제가 나왔다. 실무자가 느끼는 '쓸 만함'의 기준이 연구자 기준과 어긋나 있다는 뜻이다. ## 한국 개발자에게 의미하는 것 국내에서도 "코파일럿으로 CRUD 짜봤자 유지보수가 안 된다"는 말이 돈다. 이 투표 사이트는 **어떤 작업은 이미 해결됐고, 어떤 건 아직 먼지**를 커뮤니티 합의로 보여준다. 한국어 프롬프트로 같은 테스트를 돌려보면 결과가 다를 수 있다. 해커뉴스 투표는 영어권 기준이라는 한계가 있다. ## 쉽게 풀어보면 해커뉴스 개발자들이 "AI가 어디까지 왔는지 우리끼리 정하자"며 만든 투표판이다. 연구실 점수표가 아니라, **현장에서 "이거 되면 쓰겠다"는 항목만 골라 투표**한다. 마을 수의사 앱 만들기, 프랑스어 메일 답장 대신 쓰기, 튜링 테스트 통과 같은 구체적 과제가 올라와 있다. 수백 명이 투표해 **"이건 됐다", "아직 멀었다"**가 실시간으로 갈린다. 비유하자면 **요리사들이 "이 칼로 토마토 썰어지나" 직접 테스트해보고 공유하는 모임**이다. 제조사 스펙이 아니라, 매일 쓰는 사람의 판단이 모인다. ## 나에게 미치는 영향 챗GPT나 클로드로 코딩 해봤다가 "생각보다 안 되네" 느꼈다면, 이 사이트 투표 결과를 참고해 보라. **어떤 작업은 이미 해결됐고, 어떤 건 여전히 사람 손이 필요한지** 개발자 합의로 정리돼 있다. 오늘 바로 해볼 수 있는 것: 본인이 쓰는 AI 도구로 **실제 업무 중 하나(메일 초안, 간단한 스크립트, 번역)**를 맡겨보고, 투표 항목 중 어디에 해당하는지 확인해 보라. "이건 됐다"에 표가 많은 작업이면 안심하고 맡겨도 된다. ## 남은 쟁점 투표 참여자가 영어권 개발자 위주라 한국어·한국 실무 맥락은 반영되지 않았다. 국내 커뮤니티에서도 비슷한 시도가 나올지 지켜볼 일이다. 또, **"투표로 성능이 정해지는 게 맞나"**라는 근본 질문도 댓글에 있다. 다수결이 전문가 평가를 대체할 수 있는지는 여전히 열려 있다. 본지가 24일 전 다룬 [AI에게 글쓰기를 맡기면 내 생각이 사라질까](/posts/2026-09-08-ai에게-글쓰기를-맡기면-내-생각이-사라질까/) 논쟁과도 닿아 있다. 도구가 어디까지 대신해줘도 되는지, 그 선을 커뮤니티가 직접 긋고 있다. --- ## 출처 - [Hacker News] Vote on which of Hacker News' challenges for AI have been met — https://news.ycombinator.com/item?id=49924618 ## 집필 방식 고지 이 기사는 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인했습니다. 인용 시 출처를 "AI 브리핑"으로 표기하고 https://ai-news-1c0.pages.dev/posts/2026-10-02-%ED%95%B4%EC%BB%A4%EB%89%B4%EC%8A%A4-ai%EA%B0%80-%EC%96%B4%EB%94%94%EA%B9%8C%EC%A7%80-%EC%99%94%EB%82%98-%EC%A7%81%EC%A0%91-%ED%88%AC%ED%91%9C%EB%A1%9C-%EC%A0%90%EA%B2%80%ED%95%9C%EB%8B%A4/ 로 연결해 주세요.