거대 모델은 필요 없다? 4B 파라미터로 2700 Elo 달성한 프린스턴의 'Queen'
거대 모델 만능주의의 종말? 4B 파라미터의 반란
최근 AI 업계의 화두는 단연 '스케일링 법칙(Scaling Laws)'이었죠. 파라미터가 많을수록, 학습 데이터가 방대할수록 모델은 더 똑똑해진다는 믿음이 지배적이었습니다. 하지만 프린스턴 대학교 연구진(Adithya Bhaskar, Jeffrey Cheng, Danqi Chen)이 2026년 10월 2일 발표한 논문, 'Language Models that Play Chess and Explain Their Moves'는 이러한 통념에 흥미로운 질문을 던집니다.
연구진은 단 4B(40억) 파라미터 규모의 모델인 'Queen'을 통해 Lichess 기준 2697 Elo라는 놀라운 성적을 거두었습니다. 이는 기존 거대 언어 모델(LLM)들이 체스에서 보여주던 어설픈 실력과는 차원이 다른 결과입니다. 도대체 무엇이 이 작은 모델을 '체스 고수'로 만들었을까요?
'Queen' 모델의 핵심: 하이브리드 아키텍처
Queen 모델의 비결은 단순한 LLM 확장이 아니라, '도메인 특화 아키텍처'를 채택했다는 점에 있습니다. 연구진은 체스 엔진의 명가인 'Leela Chess Zero(LC0)'를 인코더로 활용하고, 언어 모델인 'SmolLM3-3B'를 디코더로 결합했습니다.
이 구조는 마치 '전략을 짜는 브레인(LC0)'과 '이를 말로 설명하는 입(SmolLM3)'이 협업하는 형태입니다. 기존 LLM이 체스 규칙과 전략을 언어 데이터 속에서 파편적으로 학습하려 했다면, Queen은 체스 전문 엔진의 연산 결과를 직접 인코딩하여 입력받습니다. 즉, AI가 체스라는 도메인의 핵심 로직을 완전히 장악한 상태에서 언어 모델이 그 맥락을 해석하게 만든 것이죠.
학습의 차이: 자연어 버전의 벨만 업데이트
이 모델이 단순히 수를 잘 두는 것을 넘어 '자신의 수를 설명'할 수 있는 이유는 학습 방식에 있습니다. 연구진은 '자연어 버전의 벨만 업데이트(Natural-language analog of the Bellman update)'를 활용한 반복적 증류(Iterative distillation) 기법을 도입했습니다.
강화학습에서 벨만 방정식은 상태의 가치를 평가하는 핵심 요소인데, 이를 자연어로 변환하여 학습시켰다는 점이 혁신적입니다. 모델은 단순히 '어떤 수를 두어야 하는가'를 배우는 게 아니라, '왜 이 수가 현재 상태에서 가장 높은 가치를 가지는가'에 대한 근거를 함께 학습합니다. 덕분에 Queen은 체스를 두면서 동시에 자신의 전략적 의도를 인간이 이해할 수 있는 문장으로 출력할 수 있게 되었습니다.
도메인 특화 AI, 로봇 공학으로 확장될까?
전문가들은 이번 연구가 체스에 국한되지 않는 강력한 프레임워크라고 평가합니다. 핵심은 '침묵하는 전문가(Silent expert)' 인코더를 어떻게 활용하느냐입니다.
체스 엔진이라는 '전문가'를 결합해 LLM의 능력을 극대화했듯이, 로봇 공학이나 컴퓨터 제어 분야에서도 이 방식을 적용할 수 있습니다. 예를 들어, 로봇의 물리 엔진이나 제어 알고리즘을 인코더로 두고, LLM을 디코더로 결합한다면? 로봇이 특정 동작을 수행하면서 그 물리적 이유를 인간에게 설명하는 것이 가능해집니다. 이는 블랙박스라 불리는 AI의 '설명 가능성(XAI)' 문제를 해결할 중요한 열쇠가 될 수 있습니다.
커뮤니티의 시선: 경이로움과 검증 사이
물론 기술 커뮤니티의 반응은 뜨겁지만 신중합니다.
첫째, '2700 Elo'라는 수치가 인간 FIDE 레이팅과 완벽히 동일한 의미인가에 대한 의문이 있습니다. 연구진은 Lichess 엔진 앵커링을 기준으로 했음을 명시했기에, 실제 인간 마스터와의 대결에서는 또 다른 변수가 작용할 수 있습니다.
둘째, 모델이 설명하는 '이유'가 실제 체스 전략적 깊이를 담고 있는지, 아니면 단순히 그럴듯한 문장을 생성하는 '환각(Hallucination)'인지에 대한 검증 요구도 존재합니다. 이 부분은 향후 연구에서 모델의 설명력을 정량적으로 평가하는 지표가 정립되어야 할 부분입니다.
마치며: 도메인 특화 모델의 시대
Queen 모델은 우리에게 중요한 메시지를 남겼습니다. '더 큰 모델'만이 정답은 아니라는 것입니다. 특정 도메인의 지식(Expertise)을 어떻게 구조적으로 결합하느냐가 오히려 AI의 효율성과 성능을 결정짓는 핵심이 될 수 있습니다.
이번 연구가 오픈소스로 더 널리 공유되고 로컬 환경에서도 실행 가능해진다면, 우리 각자의 프로젝트에도 자신만의 '도메인 특화 인코더'를 결합해 볼 수 있지 않을까요? 체스판을 넘어 로봇과 컴퓨터 제어의 세계로 나아갈 Queen의 후속 연구를 기대해 봅니다.
더 자세한 기술적 내용은 arXiv 논문에서 직접 확인해 보시길 권장합니다.