Agents now issue refunds, update accounts, and close tickets end to end. Running Agents in Customer Work: four Tuesdays on agentic AI in customer ops. Register for All Four
미국 현지시간으로 10월 5일, 리플렉션 AI가 드디어 첫 번째 오픈 웨이트 모델 Beam을 발표했습니다. 잘 아시다시피 ‘오픈 웨이트 모델’은 학습을 마친 모델의 가중치를 공개해서 누구나 내려받아서 자기 서버에서 돌리고 고쳐 쓸 수 있게 한 모델이죠.
리플렉션 AI는 구글 딥마인드에서 Gemini의 리워드 모델링을 이끌던 미샤 라스킨과 AlphaGo를 함께 만든 이오아니스 안토노글루가 2024년에 세운 회사입니다. 작년 10월 엔비디아가 이끈 라운드에서 80억 달러 기업가치에 20억 달러를 투자받으면서 '미국의 오픈 프런티어 AI 연구소'라는 기치를 내걸었고, 한국에서는 올해 3월 신세계와 함께 국내 최대 규모의 AI 데이터센터를 짓겠다고 발표한 회사로 더 잘 알려져 있을 겁니다. 리플렉션 AI에 대해 쓴 튜링포스트 코리아의 글도 한 번 참고해 보시구요:
Beam은 전체 파라미터가 5,010억 개지만 답의 단어 하나하나를 만들 때는 그중 230억 개만 골라 쓰는 MoE(Mixture-of-Experts, 전문가 혼합) 구조의 모델로, 코딩과 추론, 그리고 도구를 써 가면서 여러 단계의 일을 처리하는 에이전트 작업을 주 타겟으로 만들어졌습니다.
대부분의 외신 기사는 Beam을 '중국 오픈 모델에 맞서는 미국의 대안'이라는, 리플렉션이 내세운 틀 그대로 소개하고 있는데요.
Beam은 정말 '미국의 오픈소스 대안'이 될 수 있을까요?
오늘은, 리플렉션이 직접 공개한 숫자들을 하나씩 들여다보고, 이 모델이 신세계와 함께 짓는 '한국 소버린 AI'에는 어떤 의미인지 한 번 짚어 보려고 합니다.
'최고의 오픈 모델'을 이야기하던 회사의 첫 성적표
이전에 튜링포스트와 나눈 인터뷰에서, 리플렉션 AI의 창업자 안토노글루는 "저희한테 중요한 건, 첫 모델들을 세상에서 가장 좋은 오픈 모델로 만드는 겁니다"라고 말했습니다. 목표가 처음부터 '서구에서 제일'이 아니라 '세계에서 제일'이었던 거예요.
그런데 이번 발표에서 리플렉션은 Beam이 '서구 오픈 웨이트 모델의 프런티어를 한 단계 끌어올렸다'고 이야기합니다. 글쎄요, Beam이 타겟으로 하는 코딩과 에이전트 작업이라는 영역에서 이미 중국 연구소들의 오픈 모델은 저만치 앞서 나가고 있는데, Beam을 ‘서구의 프런티어’라고 부르는 게 어떤 큰 의미가 있을까 싶기는 합니다. 2월에는 ‘세계’를 목표로 하던 게 어느새 ‘서구’로 좁혀진 셈이예요.
생각보다 큰 격차
리플렉션이 직접 발표한 비교표만 봐도 격차는 분명한데, 이 표에는 빠진 결과도 있습니다. 저희 튜링포스트 팀이 머코어(Mercor)의 평가 결과를 따로 찾아보니까, 알리바바의 Qwen과 딥시크 모델의 결과 여섯 개가 표에 들어가 있지 않았거든요.
아래 표에는 이 결과들을 별표(*)로 표시해서 함께 넣었습니다.

표에 나오는 벤치마크는 대부분 AI가 실제 소프트웨어 저장소의 버그를 고치거나, 터미널에서 명령어를 쓰면서 개발 작업을 끝까지 해내는지를 재는 시험인데요. 새로 추가한 결과를 빼고 리플렉션의 비교만 놓고 보더라도, Beam은 DeepSWE에서 DeepSeek V4.1 Flash보다 30%포인트 가까이, Terminal-Bench에서는 10%포인트 넘게 뒤져 있습니다. Beam이 애초에 잘하라고 만든 영역에서 벌어진 격차라서, 가볍게 넘길 수준은 아니라고 생각합니다.
'서구 모델 중에서는'이라는 단서를 붙인다면?
물론, 비교의 범위를 서구 모델로 좁히면 이야기가 좀 달라지기는 합니다.
미스트랄의 Mistral Medium 3.5는 SWE-Bench Verified에서 77.6점으로 Beam(80.9점)보다 낮습니다. 대학원 수준의 과학 문제를 푸는 GPQA Diamond에서는 구글의 Gemma 4 31B가 84.3점으로 Beam(90.5점)에 못 미치고, 지시를 얼마나 정확히 따르는지 보는 IFBench에서도 앨런 AI 연구소(Ai2)의 Olmo 3.1 32B Think가 68.1점으로 Beam(79.7점)보다 낮습니다.
모델 크기도 평가 설정도 서로 달라서 단순하게 비교하기는 어렵지만, 적어도 '서구 오픈 모델 중에서는 앞서 있다'는 리플렉션의 주장이 빈말은 아니라는 정도는 이 결과들이 보여줍니다.
그럼 Beam을 왜 써야 할까? 리플렉션의 답은 '효율'
리플렉션이 내세우는 건 ‘성능’보다 ‘효율’입니다. 고급 추론 벤치마크에서 Beam은 중국 Z.ai의 GLM 5.2와 비슷한 점수를 내면서도, 답을 만드는 데 드는 연산량은 3분의 1에서 4분의 1 정도밖에 쓰지 않는다는 게 리플렉션의 설명입니다. 이게 실제로 쓸모 있는 일을 더 싸게 해내는 데까지 이어진다면, 개발자들이 관심을 가질 이유는 충분하겠죠.

리플렉션AI가 공개한, 추론 연산량 대비 Beam의 성능 비교 차트. Image Credit: Reflection AI
문제는, 이 계산 결과도 실제 사용자가 받아들게 될 청구서와는 거리가 있다는 점입니다. 입력한 프롬프트를 처리하는 비용도, 문맥이 길어질수록 늘어나는 연산량도, 모델을 실제로 돌려서 응답을 내주는 데 드는 비용(서빙)도 계산에서 빠져 있기 때문입니다.
효율을 보여주는 차트에 Kimi K3, GLM 5.3, DeepSeek V4.1 Flash 같은 최신 모델, 더 강력한 경쟁 모델들이 빠져 있다는 것도, 유리한 비교 대상만 고른 것 아니냐는 의문을 불러일으킬 수 있습니다.
오픈 모델을 업무 환경에서 직접 띄워서 업무에 써 보신 분이라면 공감하실 텐데, 결국 알고 싶은 건 '한 번 돌리는 비용'이 아니라 '일 하나를 끝까지 성공시키는 비용'입니다. 한 번 돌리는 값이 싸더라도 몇 번씩 다시 돌려야 하거나 사람이 결과를 고쳐야 한다면, 그 차이는 사실 의미가 없을 수도 있으니까요.
아직 아무도 검증할 수 없는 모델
안토노글루는 같은 인터뷰에서 "결국 가장 중요한 지표는 채택(Adoption)입니다"라고 말을 하기도 했습니다. 얼마나 많은 사람이 실제로 가져다 쓰느냐가 성적표라는 얘기인데, 지금은 그 성적표를 매기기가 어렵습니다. 대기자 명단으로 일부에게 초기 버전을 열어 두었을 뿐이고, 누구나 내려받아 돌려 볼 수 있는 가중치는 아직 공개하지 않았으니까요.
아파치 2.0(Apache 2.0) 라이선스의 가중치와 기술 보고서, 모델 카드는 10월 중에 공개한다고 하는데, 가중치도 없이 발표부터 한 것 역시 아쉬운 선택이라고 봅니다. 독립적으로 검증할 수 없는 모델에 대해서는, 개발자도 독자도 회사가 내놓은 숫자에 기댈 수밖에 없으니까요.
물론, Beam이 '가성비 좋은 일꾼 모델'로 자리를 잡을 가능성도 있지만, 지금까지 나온 근거만 놓고 보면, 2월에 이야기했던 '세계 최고의 오픈 모델'과는 거리가 꽤 먼 것 아닌가 싶습니다. 이미 좋은 모델이 차고 넘치는 상황에서 또 하나의 평범한 모델로는 많은 고객이 채택하기도 쉽지 않을 수 있습니다.
소버린 AI, 모델의 국적보다 중요한 것
이 이야기가 한국에서 남의 일이 아닌 이유는, Beam이 신세계의 '소버린 AI 팩토리'에 올라갈 가장 유력한 후보이기 때문입니다. 신세계그룹은 올해 3월 리플렉션 AI와 손잡고 국내에 250MW 규모의 AI 데이터센터를 짓겠다고 밝혔고, 라스킨은 리플렉션이 만든 미국산 오픈 모델 위에 한국의 소버린 클라우드를 짓겠다고 했습니다.
다만, 소버린 AI에서 중요한 건 모델이 어느 나라 것이냐보다 필요할 때 다른 모델로 갈아탈 수 있느냐라고 생각합니다. 그렇게 보면, Beam이 중국 모델보다 뒤처졌다는 게 한국에서는 생각만큼 큰 문제가 아닐 수도 있습니다. 갈아탈 수 있다면 Beam이 좀 처져도 나중에 바꾸면 되고, 갈아탈 수 없다면 Beam이 1등이어도 주권이라고 하기는 어려우니까요.
가중치와 기술 보고서는 10월 중에 공개될 예정이고, 독립적인 평가 결과가 나오는 대로 다시 짚어 보겠습니다.
튜링 포스트 코리아는 독자들의 응원으로 만들어집니다. 가치있는 컨텐츠를 지속적으로 여러분과
공유할 수 있도록, 커피 한 잔으로 힘을 보태주세요 ☕





