신모델·

8GB 그래픽카드로 돌리는 '계속 학습' 모델, 미니-AGI 등장

한 줄 요약8GB VRAM으로 무한 학습하는 개인형 모델 미니-AGI가 깃허브에 공개됐다
광고

깃허브에 '미니-AGI(mini-AGI)'라는 저장소가 올라왔다. 단일 8GB VRAM 그래픽카드에서 처음부터 학습하며, 읽는 족족 가중치를 갱신하는 바이트 수준 언어 모델이다. 작성자 볼로타트(volotat)는 "장난감 수준"이라며 기대치를 낮췄다. 하지만 아키텍처 자체가 VRAM 한계를 디스크로 우회한다는 점에서 기존 로컬 LLM과 결이 다르다.

기존 모델과 뭐가 다른가

지금 쓰는 로컬 LLM은 누가 학습시킨 '완제품'을 내려받아 쓰는 방식이다. 파인튜닝으로 가장자리를 다듬을 순 있어도, 내 대화 내용을 반영해 계속 학습시키면 이전에 알던 지식을 잊어버린다(치명적 망각). 미니-AGI는 이 문제를 구조적으로 풀려 한다. 가중치를 일반 파일로 디스크에 두고, 필요할 때만 VRAM으로 페이징해 올린다. 따라서 파라미터 상한이 VRAM이 아니라 빈 디스크 용량이 된다.

학습 중에 용량이 부족하면 새 '전문가(엑스퍼트)' 블록을 동적으로 늘리고, 아무도 쓰지 않는 건 가지치기한다. 현재 5억 3천만 파라미터에서 시작해 계속 커지는 중이다. 읽기와 생성이 같은 포워드 패스로 돌고, 별도 파인튜닝 단계가 없다. "읽는 행위 자체가 학습"이라는 설계다.

아키텍처: 고정 스택이 아니라 동적 라우팅

문자(바이트)가 고정된 레이어 스택을 통과하는 트랜스포머와 달리, 미니-AGI는 두 개의 밀집 프리루드 블록 + 최대 24회 반복되는 재귀 블록으로 구성된다. 재귀 블록이 돌 때마다 공유 풀에서 전문가 8개를 골라 실행한다. 잠재 상태는 디코딩되지 않고 어댑터를 통해 다음 입력과 합쳐지므로, 루프가 텍스트에서 이탈하지 않는다.

한 문자당 4~14단계(최대 24)를 오가며 깊이를 조절한다. 생성할 땐 읽기보다 깊은 9.9단계 평균을 쓴다. 위치 인코딩은 학습 파라미터 없는 회전식을 써서, 컨텍스트 창을 재초기화 없이 확장 학습으로 늘릴 수 있다. 작성자가 올린 라이브 데모 영상에서 이 동적 스택 성장·축소 과정을 직접 볼 수 있다.

광고

아직은 '장난감' — 가중치도 미공개

작성자 스스로 "프론티어급 능력은 기대 말라"고 못 박았다. 첫 번째 코퍼스 패스를 다 도는 데만 몇 주가 더 걸린다. 가중치 파일은 아직 공개되지 않았다. 해커뉴스에는 작성자 본인이 "이름은 오만하지만 내가 바라는 AGI 조각들을 다 넣으려 했다"고 단 댓글 하나(점수 8)만 있다. 레딧 r/LocalLLaMA에선 점수 6, 댓글 0으로 반응이 미미하다.

쉽게 풀어보면

미니-AGI는 볼로타트가 만든, 내 노트북에서 태어나 내 대화로 자라는 모델을 지향한다. 비유하자면, 서점에서 산 책(기존 LLM)은 누가 읽든 내용이 같지만, 이 모델은 내가 쓴 일기장을 매일 밤 스스로 읽고 지혜를 갱신하는 노트에 가깝다.

핵심 차이는 '메모리 한계'를 디스크로 넘겼다는 점이다. 8GB VRAM만 있으면 시작할 수 있고, 하드디스크가 허용하는 만큼 모델이 커진다. 읽기와 학습이 분리되지 않아, 오늘 배운 걸 내일 까먹는 '치명적 망각' 문제를 구조적으로 피하려 했다.

아직은 5억 파라미터 수준으로, GPT-4o나 라마 3.1 70B 같은 대형 모델과 대화 품질을 겨룰 단계는 아니다. 작성자도 "몇 주 뒤 첫 패스 끝나면 가중치 올리겠다"고만 했다. 하지만 '내 하드웨어에서 끝까지 학습하는 개인 모델'이라는 컨셉 자체는 로컬 AI 커뮤니티가 오랫동안 기다리던 것이다.

나에게 미치는 영향

당장 쓸 건 없다. 가중치가 없어서다. 하지만 8GB VRAM 노트북을 가진 사람이라면 저장소에 별표(Star)만 눌러두자. 첫 가중치 공개 시점에 바로 이어서 학습(continual training)할 수 있다.

오늘 확인해 볼 것:

  • 깃허브 README의 '히스토리' 링크(학습 과정 샘플)
  • 라이브 대시보드 스크린샷

모델이 문자 단위로 전문가를 골라 깊이를 조절하는 모습이 시각화돼 있다. 로컬 AI 취미가라면 이 아키텍처만으로도 연구 가치가 있다.

기존 구독형 LLM(챗GPT, 클로드 등)을 쓸 땐 '내 데이터가 남의 서버에서 학습될까' 걱정하지만, 이 방향이 완성되면 내 기계, 내 데이터, 내 모델이 된다. 단, 전기세와 시간은 본인 부담이다.

큰 그림: 'AGI' 마케팅과 다른 길

본지가 앞서 다룬 GPT-6 아스트라 'AGI' 주장에 커뮤니티가 회의적이었던 이유엔비디아 CEO의 'AGI 도래' 발언을 마케팅 용어로 본 시각과 대비된다. 빅테크는 벤치마크 점수로 'AGI 근접'을 홍보하지만, 미니-AGI는 검증 불가능한 초지능 주장 대신 '끝까지 학습하는 개인 모델'이라는 구체적 구현을 내놨다.

작성자도 "이름은 오만하지만, 내가 AGI에 바라는 조각들을 다 넣으려 했다"고 인정했다. 허황된 약속 대신 돌아가는 코드와 아키텍처로 보여준 점이 다르다.

남은 쟁점

  • 치명적 망각 완전 해결 여부: 재귀 블록과 어댑터 구조로 잠재 상태 드리프트를 막았다지만, 수억 토큰 이상 장기 연속 학습에서 정말 잊지 않는지는 미검증이다.
  • 추론 속도: 동적 라우팅·페이징 오버헤드가 실사용에서 병목이 될 수 있다.
  • 데이터 품질 의존도: "능력은 하드웨어·데이터·시간에 달렸다"는 말대로, 개인 사용자가 양질의 지속적 코퍼스를 확보하기 쉽지 않다.

가중치 공개와 커뮤니티 포크가 이어지면 답이 보일 것이다. 그때까지는 '가능성을 증명한 실험'으로 둔다.

이 기사의 출처

이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.

광고