GLM 5.2 대 Opus — 오픈 가중치 모델의 실용적 가능성

2026.07.02

·

✦ guniq 시각

동일한 원샷 프롬프트로 WebGL 3D 플랫폼 게임을 만들게 한 실험에서 GLM-5.2는 4분의 1 미만 비용($5.39 대 $21.92)으로 Claude Opus와 경쟁했다. 최고 완성도가 필요한 고부가가치 작업은 Opus가 맞다. 하지만 대량 반복 코드 생성, 사내 인프라 내 데이터 주권 확보, 파인튜닝 기반 도메인 특화 등 세 가지 시나리오라면 MIT 라이선스 오픈 가중치 모델이 실질적인 대안이 된다. 비용과 성능 사이의 선택지가 넓어졌다는 것이 핵심이다.

▲ 이미지 출처: GeekNews

Sponsored

2026년 6월, AI 모델 비교 실험 하나가 개발자 커뮤니티에서 주목을 받았다. 동일한 원샷 프롬프트로 raw WebGL 3D 플랫폼 게임을 처음부터 만들게 했을 때, GeekNews가 공유한 결과에 따르면 Claude Opus는 33분 만에 더 완성도 높은 결과를 냈고 GLM-5.2는 70분이 넘게 걸렸지만 비용은 4분의 1에 불과했다. 이 숫자 하나가 오픈 가중치 모델과 상용 폐쇄형 모델 사이의 현재 위치를 압축적으로 보여준다.

GLM-5.2란 무엇인가: 753B MoE, MIT 라이선스

GLM-5.2는 중국의 Z.ai(구 智谱AI, Zhipu AI)가 2026년 6월 13일 코딩 구독자에게 먼저 공개하고, 6월 16일 전체 오픈 가중치를 Hugging Face(`zai-org/GLM-5.2`)에 MIT 라이선스로 공개한 대규모 언어 모델이다. 총 파라미터 수는 753억 개(750B)이지만, 혼합 전문가(MoE) 설계 덕분에 실제 토큰 처리 시 활성화되는 파라미터는 약 400억 개(40B active per token)에 그친다.

가장 주목할 기술적 특징은 IndexShare 아키텍처다. 이 설계는 같은 어텐션 인덱서를 여러 희소 레이어에 걸쳐 재사용하는 희소 어텐션 방식으로, 1M 토큰 문맥에서 토큰당 FLOPs를 2.9배 줄인다. Simon Willison의 기술 분석에 따르면 컨텍스트 윈도우는 GLM-5.1의 200,000 토큰에서 1M 토큰으로 5배 확장됐고, 응답당 최대 131,072 토큰을 출력할 수 있다. 모델 전체 용량은 약 1.51TB다.

WebGL 게임 생성 실험: 숫자로 보는 격차

GeekNews에서 공유된 비교 실험은 동일한 원샷 프롬프트를 두 모델에 동시에 입력해 진행됐다. 과제는 게임 엔진이나 외부 라이브러리 없이, GLB 모델 파싱·행렬·벡터 수학·GLSL 셰이더·스켈레탈 애니메이션·충돌 감지·팔로우 카메라를 포함하는 raw WebGL 3D 플랫폼 게임을 처음부터 작성하는 것이었다.

항목GLM-5.2Claude Opus
완료 시간1시간 10분 40초33분 30초
실제 비용$5.39$21.92
출력 토큰131,000216,809
도구 호출 횟수128회153회

결과물 품질에서는 차이가 분명했다. Claude Opus는 텍스처가 정상 적용된 깔끔한 구현과 작동하는 게임 메커닉을 내놨다. GLM-5.2는 캐릭터 텍스처와 머티리얼 누락, 비작동 스파이크 트랩, 미완성 승리 조건, 디버그 오버레이가 화면에 남아 있는 문제가 있었다. 그러나 비용은 Opus의 4분의 1 미만($5.39 대 $21.92)이었다.

여기서 간과할 수 없는 구조적 한계도 드러났다. GLM-5.2는 현재 텍스트 전용 모델로, 이미지를 읽지 못한다. 즉 자신이 생성한 UI나 시각적 결과물을 직접 확인하며 자기 검증(self-validation)을 할 수 없다는 뜻이다. Claude Opus가 스크린샷을 보고 수정 방향을 잡을 수 있는 것과 대비된다.

공식 벤치마크: 강점과 한계의 공존

Z.ai가 발표한 자체 벤치마크 수치는 인상적이다. The AI Rankings가 집계한 GLM-5.2의 주요 수치는 다음과 같다(이하 Vendor-reported, 즉 Z.ai 자체 측정값).

  • AIME 2026: 99.2점 (Claude Opus 95.7 대비 우세)
  • GPQA Diamond: 91.2%
  • SWE-bench Pro: 62.1% (GPT-5.5의 58.6% 상회)
  • Terminal-Bench 2.1: 81.0% (Claude Opus 4.8이 85.0으로 선두)
  • HLE with Tools: 54.7%
  • Artificial Analysis Intelligence Index v4.1: 51점 (오픈 가중치 모델 중 최고)

그러나 코딩 장기 과제 SWE-Marathon에서는 GLM-5.2가 13.0, Claude Opus가 26.0으로 두 배 이상 격차가 난다. 또 중요한 주의사항이 있다. Eigent AI의 분석은 “Z.ai는 출시 시점에 완전한 공식 벤치마크 모음을 발표하지 않았다(Z.ai notably did not publish a full, official benchmark suite for GLM-5.2)”고 명시한다. 즉 위 수치는 독립 기관 검증 없이 Z.ai가 선별 공개한 결과다. Artificial Analysis Intelligence Index v4.1의 51점은 독립 평가에 해당하지만, 나머지 수치는 제조사 보고값임을 감안해야 한다.

비용 구조: API vs 자체 호스팅

GLM-5.2의 가격 경쟁력은 두 가지 경로로 나뉜다. Layer3Labs 비즈니스 가이드에 따르면 Z.ai API 직접 이용 시 입력 $1.40/M · 출력 $4.40/M(캐시 입력 $0.26), OpenRouter 경유 시 $1.00/$4.00이다. Claude Opus 4.7 기준으로는 입력 $5/M · 출력 $25/M이니, 동일 API 호출 기준으로 GLM-5.2가 약 3.5~6배 저렴하다.

더 강력한 옵션은 자체 호스팅이다. MIT 라이선스로 오픈된 가중치를 직접 서버에 올리면 “토큰당 요금 없이 인프라 비용(GPU 컴퓨팅·스토리지·대역폭)만 부담”하게 된다. 1.51TB 모델인 만큼 H100 80GB GPU가 다수 필요하며 초기 인프라 비용이 상당하지만, 대규모 내부 반복 작업이나 외부 API로 데이터를 내보내기 어려운 산업(의료·법무·금융)에서는 구조적 이점이 된다.

오픈 가중치의 의미: 데이터 주권과 커스터마이징

MIT 라이선스가 부여하는 권리는 단순한 무료 사용에 그치지 않는다. Layer3Labs 가이드는 “상업적 이용, 수정, 자체 호스팅, 재배포를 제한 없이 허용한다(permits commercial use, modification, self-hosting, and redistribution with few restrictions)”고 정리한다. 이는 곧 파인튜닝을 통한 도메인 특화, 자체 서버에서의 완전한 데이터 통제, 내부 제품 통합이 모두 가능함을 의미한다.

다만 데이터 주권 측면에서 하나의 중요한 구분선이 있다. 같은 가이드는 “Z.ai 호스팅 API를 이용할 경우, 데이터 주권 문제는 다른 중국 기업 호스팅 모델과 동일한 수준으로 제기된다(raises the same data-sovereignty questions as any hosted Chinese model)”고 명시한다. 즉, 데이터 주권 확보는 오픈 가중치를 직접 온프레미스나 자사 클라우드에 배포할 때만 온전히 실현된다. API 경유 이용은 편의성은 높지만 주권 면에서는 다른 상용 API와 다를 게 없다.

중소기업 시사점: 언제 GLM-5.2를, 언제 Opus를

이번 비교는 “어느 모델이 더 좋은가”가 아니라 “어느 상황에 어느 모델이 맞는가”의 문제임을 잘 보여준다. 중소 규모 팀이나 스타트업 관점에서 판단 기준을 정리하면 다음과 같다.

  • GLM-5.2 API가 유리한 경우 — 대량의 반복적 코드 생성·문서 처리·데이터 변환처럼 비용이 민감하고 최고 완성도보다 처리량이 중요한 작업. API 비용이 Claude Opus 대비 3.5~6배 저렴하다.
  • GLM-5.2 자체 호스팅이 유리한 경우 — 고객 데이터·의료 기록·계약서 등 외부 서버로 전송 불가한 민감 정보를 다루는 작업. 온프레미스 배포 시 토큰당 비용이 사라지고 데이터가 자사 서버 밖으로 나가지 않는다.
  • 파인튜닝이 유리한 경우 — 특정 도메인(법무·의료·제조 QA 등)에서 반복 사용할 때. MIT 라이선스로 자체 데이터 파인튜닝 후 상업 배포가 자유롭다. GPU 인프라와 ML 경험이 필요하다는 점은 고려해야 한다.
  • Claude Opus가 유리한 경우 — 고객 납품물, 복잡한 멀티스텝 에이전트 작업, 시각 정보(이미지·화면)를 동반한 작업, SWE-Marathon 같은 장기 코딩 과제. 특히 이미지 입력 없이는 결과물을 자체 검증할 수 없다는 GLM-5.2의 현재 한계가 결정적이다.
  • 하이브리드 전략 — 초안·분류·반복 생성은 GLM-5.2(저가), 최종 검토·고객 대면·정확성이 중요한 작업은 Opus(고성능). 두 모델의 가격 차이를 활용해 예산 최적화가 가능하다.


MORE POSTS

다른 글 보기

테크 랩

GroupFlow 콜센터 통합 – 06. 통화 녹취, 금융사만 하는 거 아닙니다: 일반 기업이 녹취를 남겨야 하는 이유

통화 녹취는 금융사만? 일반 기업의 녹취 필요성과, 쌓아만 두지 않고 STT로 검색하는 녹취 관리.
2026.09.18
테크 랩

GroupFlow 콜센터 통합 – 05. 부재중 전화, 그냥 사라지고 있지 않나요: 통화 추적과 후속 관리 자동화

부재중 전화를 놓치지 않는 통화 추적·후속 관리 자동화 — 처리상태 태그·후속 필터·대시보드·문자 후속.
2026.09.17
테크 랩

GroupFlow 콜센터 통합 – 04. 교환기는 있는데 소프트폰만 쓰나요: LG U+ DCS를 그룹웨어에 연동하다

LG U+ DCS 같은 IP-PBX 교환기를 교체하지 않고 그룹웨어에 연동 — 레거시 소프트폰을 무중단으로 대체하는 방법.
2026.09.16

프로젝트 문의 환영합니다

기획부터 개발, 운영까지 함께 만들어 드립니다.

무료 3분 자가진단

우리 회사, 자체 클라우드가 답일까?

AWS vs 자체 인프라 · 11개 항목 3분 체크