이슈분석

K-엑사원 2.0, 국내 최대 AI 모델이 스스로 공개한 성적표에서 24개 중 1위는 3개였다

LG AI연구원이 파라미터 7,500억 개 규모의 K-엑사원 2.0을 아파치 2.0으로 공개했다. 자사가 함께 올린 모델 카드의 벤치마크 24개를 전수 대조하면 비교 3사를 모두 제친 항목은 3개이고, 한국어 항목 3개는 모두 딥시크 V4 프로가 앞선다. 총 파라미터와 활성 파라미터의 차이, 과기정통부 독파모 2차 평가 구조, 아파치 2.0 전환이 실제로 바꾸는 지점을 원전 기준으로 정리한 해설. 목표가나 매매 판단은 제시하지 않는다.

1. 열흘 사이에 벌어진 일

7월 하순 국산 대형언어모델이 연달아 공개됐다. 23일 업스테이지의 솔라 오픈 2, 29일 SK텔레콤의 A.X K2, 31일 LG AI연구원의 K-엑사원 2.0이다. 여기에 모티프테크놀로지스가 모티프 3 베타 가중치를 허깅페이스에 올려 두고 21일 중간 성과를 발표했다.7 마지막에 나온 모델이 가장 컸고, 헤드라인을 가져갔다. 파라미터 7,500억 개, 국내 최대, 아파치 2.0 전면 개방.1

네 회사는 모두 과학기술정보통신부의 독자 AI 파운데이션 모델 사업, 줄여서 독파모의 참가팀이다. 2차 평가가 진행 중이고, 국민 평가단 200명의 사용 평가가 8월 8일부터 11일까지 잡혀 있다.4 네 팀 중 셋만 다음 단계로 간다. 공개가 이 일정 직전에 몰렸다는 사실은 확인되지만, 각 사가 그 이유를 밝힌 자료는 찾지 못했다.

이 리포트는 그중 가장 큰 모델의 성적표를 원전으로 확인한 결과를 다룬다. LG AI연구원이 허깅페이스에 함께 올린 모델 카드에는 벤치마크 24개를 경쟁 모델 셋과 나란히 놓은 표가 실려 있다.2 보도 요약본이 아니라 그 표를 그대로 읽으면, 헤드라인과 다른 그림이 나온다.

독파모 2차수 모델 총 파라미터0225450675900750K-엑사원 2.07월 31일688A.X K27월 29일314모티프 3 베타7월 중250솔라 오픈 27월 23일단위: 십억 개활성 파라미터 370억·미공개·130억·150억 · 각 사 공개 자료
자체 제작 차트 · 매매 판단 지표 아님 · 출처: 각 사 공개 자료

2. 모델 카드를 펼치면 다른 표가 있다

공개 직후 보도는 두 가지를 앞세웠다. 국내 최대 규모, 그리고 성능과 안전성에서 중국 모델을 앞섰다는 것이다.1 두 번째 주장의 근거가 되는 표가 모델 카드에 있다. 9개 영역 24개 벤치마크를 알리바바 큐웬 3.5, 즈푸 GLM-5.1, 딥시크 V4 프로와 대조한 표다.2

표를 전부 세어보면 이렇다. 벤치마크 24개 가운데 K-엑사원 2.0이 비교 3사를 모두 제치고 1위에 오른 항목은 세 개다. 장문 이해 OpenAI-MRCR, 그리고 안전성 두 항목이다. 나머지에서는 대체로 뒤졌다.2

벤치마크(영역)K-엑사원 2.0큐웬 3.5GLM-5.1딥시크 V4 프로출처
MMLU-Pro(지식)83.589.886.087.52
GPQA-Diamond(지식)82.288.486.290.12
Humanity’s Last Exam(지식)18.328.731.037.72
AIME 2026(수학)92.391.395.395.22
SWE-bench Verified(코딩)68.276.473.680.62
Terminal-Bench 2.1(코딩)43.851.361.864.02
τ3-Banking(툴 사용)14.213.411.525.82
OpenAI-MRCR(장문)94.493.071.592.92
KGC-Safety(안전성)99.892.069.382.82
ROK-Fortress(안전성)89.586.173.247.62

굵게 표시한 값이 해당 행의 최고점이다.

딥시크 V4 프로가 앞선 항목 가운데 K-엑사원 2.0의 열세가 가장 큰 곳은 컨테이너 환경에서 작업을 수행하는 에이전트 평가 Terminal-Bench 2.1로 20.2점 차다.2 배수로 보면 난이도 최상위 지식 시험 Humanity’s Last Exam이 18.3점 대 37.7점으로 두 배가 넘는다.2 반대로 표 전체에서 두 모델의 점수 차가 가장 큰 항목은 안전성 ROK-Fortress로 41.9점이며, 이쪽은 K-엑사원 2.0이 앞선다.2

K-엑사원 2.0과 딥시크 V4 프로 벤치마크 대조028.3256.6484.96113.2883.587.5MMLU-Pro지식18.337.7HLE최상위 지식68.280.6SWE-bench코딩69.180.5KMMLU-Pro한국어94.492.9MRCR장문89.547.6ROK-Fortress안전성K-엑사원 2.0딥시크 V4 프로(추론 최대)단위: 점출처: LG AI연구원 모델 카드 · 딥시크는 추론 최대 모드 기준
자체 제작 차트 · 매매 판단 지표 아님 · 출처: LG AI연구원 모델 카드

3. 한국어 시험에서도 뒤졌다

가장 눈에 띄는 대목은 따로 있다. 모델 카드의 한국어 항목 세 개에서 K-엑사원 2.0은 딥시크 V4 프로에 모두 뒤진다.2

한국어 벤치마크K-엑사원 2.0큐웬 3.5GLM-5.1딥시크 V4 프로출처
KMMLU-Pro69.177.475.880.52
CLIcK84.288.988.791.62
HRM8K-KSM91.191.289.494.32

한국어 전문지식을 묻는 KMMLU-Pro에서 국산 최대 모델이 69.1점, 중국 모델이 80.5점이다.2 이 표는 경쟁사가 만든 게 아니라 LG AI연구원이 직접 공개한 것이다. 자사에 불리한 숫자를 지우지 않고 실은 점은 평가할 만하지만, “한국어는 국산 모델이 낫다”는 통념은 이 표 앞에서 유지되기 어렵다.

지식·수학·코딩에서 벌어진 격차가 한국어 항목에서도 비슷한 폭으로 나타난다는 점은 눈여겨볼 만하다. 다만 이 세 항목만으로 한국어 능력의 결정 요인을 단정할 수는 없다.

안전성은 반대다. K-엑사원 2.0은 KGC-Safety 99.8점, ROK-Fortress 89.5점으로 비교 모델을 모두 앞선다.2 두 시험의 성격은 서로 다르다. KGC-Safety는 LG AI연구원이 자체적으로 만든 벤치마크이고,10 ROK-FORTRESS는 스케일 AI 등이 공개한 한미 문화·지정학 맥락의 이중언어 안전성 연구다.11 특히 ROK-Fortress에서 딥시크 V4 프로가 47.6점에 그친 것은 격차가 뚜렷하다.


4. 총 파라미터가 말해주지 않는 것

헤드라인의 숫자는 총 파라미터다. 정식 모델명은 K-EXAONE-2.0-750B-A37B이고, 뒤의 A37B가 실제 연산에 관여하는 활성 파라미터를 뜻한다. 토큰 하나를 처리할 때 깨어나는 건 370억 개다.2

전문가 혼합 구조에서는 흔한 설계다. 전문가 256개 가운데 8개와 공유 전문가 1개만 활성화된다.2 비교해야 할 것은 전작과의 배수다.

구분K-엑사원(1차수)K-엑사원 2.0배수출처
총 파라미터2,360억7,500억3.2배2 8
활성 파라미터230억370억1.6배2 8

“규모를 3배 이상 키웠다”는 표현은 총 파라미터 기준으로 맞다. 다만 토큰 하나를 처리할 때 깨어나는 활성 파라미터는 1.6배 늘었다.28 총 파라미터는 메모리에 올려야 할 가중치의 크기와, 활성 파라미터는 토큰당 연산량과 대체로 함께 움직인다. 실제 서비스 원가와 응답 속도는 여기에 더해 정밀도와 양자화, 메모리 대역폭, 전문가 간 통신, 배치 크기와 컨텍스트 길이까지 작용하므로, 활성 파라미터 배수가 그대로 비용 배수가 되지는 않는다.

같은 잣대를 경쟁 모델에도 대면 그림이 뚜렷해진다. 모티프 3은 총 3,140억 개에 활성 130억 개, 솔라 오픈 2는 총 2,500억 개에 활성 150억 개다.4 그리고 총 파라미터로만 줄을 세우면 국산 최대 모델도 중국 최상위권에는 못 미친다. 문샷AI의 키미 K3는 총 2조 8,000억 개 규모다.9


5. 그래도 도약한 축은 분명히 있다

여기서 멈추면 이 모델을 잘못 읽는 것이 된다. 모델 카드는 1차수 K-엑사원과의 직접 비교도 싣고 있는데, 특정 축에서는 진전이 크다.

벤치마크1차수2.0변화출처
OpenAI-MRCR(장문)52.394.4+42.12
SWE-bench Verified(코딩)49.468.2+18.82
ROK-Fortress(안전성)60.989.5+28.62
PolyMath(다국어 수학)57.471.3+13.92
Terminal-Bench 2.130.343.8+13.52
τ3-Banking(툴 사용)14.214.20.02

장문 이해에서 52.3점이 94.4점이 된 것은 성격이 다른 도약이다.2 이 항목에서는 비교 3사를 모두 앞섰다. 긴 계약서나 규정집을 통째로 넣고 쓰는 업무 환경에서는 평균 점수보다 이 지표가 더 중요할 수 있다. 다만 모델 카드가 밝힌 컨텍스트 윈도는 26만 2,144토큰인데, 기술보고서의 MRCR 평가는 12만 8,000토큰 구간까지만 수행됐다.12 선언된 최대 길이 전 구간에서 같은 성능이 나온다는 근거는 공개 자료에 없다.

반대편에는 움직이지 않은 숫자가 있다. 에이전틱 툴 사용 평가 τ3-Banking은 1차수와 2.0이 똑같이 14.2점이다.2 규모를 3배로 키운 세대에서 이 항목만 제자리였다. 비교 모델도 대부분 낮지만 딥시크 V4 프로는 25.8점으로 확연히 높다.2 도구를 여러 번 호출하며 절차를 밟는 이 평가에서 개선이 관측되지 않았다는 사실은 표에 그대로 남아 있다. 다른 도구 사용 과제까지 같다고 볼 근거는 이 표에 없다.

K-엑사원 2.0의 전작 대비 벤치마크 변화-112.4125.8139.2252.62+42.1MRCR장문+28.6ROK-Fortress안전성+18.8SWE-bench코딩+13.9PolyMath다국어 수학+13.5Terminal-Bench에이전트+0τ3-Banking툴 사용단위: 포인트출처: LG AI연구원 모델 카드 · 1차수 236B 대비
자체 제작 차트 · 매매 판단 지표 아님 · 출처: LG AI연구원 모델 카드

6. 탈락자가 나오는 경쟁

독파모는 단계마다 팀이 줄어드는 사업이다. 정부는 독자 모델의 조건을 해외 모델 미세조정이 아니라 설계부터 사전학습 전 과정을 자체 수행한 국산 모델로 규정했다.6

시작은 다섯 팀이었다. 2026년 1월 15일 1차 평가에서 네이버클라우드와 NC AI가 탈락했다.5 네이버클라우드는 점수보다 독자성 기준에서 걸렸다. 가중치 초기화 이후 전면 학습을 수행한 독자 모델로 보기 어렵다는 판단이었다.6 LG AI연구원은 벤치마크 33.6점, 전문가 31.6점, 사용자 평가 25점 만점으로 전 부문 1위였다.6 이후 정부가 정예팀 한 곳을 추가로 뽑아 모티프테크놀로지스가 합류했고, 현재 네 팀 경쟁이다.16

독자 AI 파운데이션 모델 사업의 관문참가 5개 팀LG·SKT·업스테이지네이버클라우드·NC AI1차 평가2026년 1월 15일네이버·NC 탈락정예팀 추가모티프 합류4개 팀 체제2차 평가국민 평가단 8월 8-11일4개 팀 중 3개 팀 진출사용자 평가는 1차부터 있었다. 2차에서 달라진 것은 일반 국민 200명의 참여다출처: 과기정통부 발표 및 보도 종합
자체 제작 차트 · 매매 판단 지표 아님 · 출처: 대한민국 정책브리핑

여기서 한 가지는 바로잡아야 한다. 사용성 평가가 이번에 새로 들어왔다는 설명은 사실과 다르다. 1차 평가에도 사용자 평가가 25점 배점으로 존재했고, AI 전문 사용자 49명이 참여했다.6 2차에서 달라진 것은 평가자의 구성이다. 일반 국민 200명이 8월 8일부터 11일까지 직접 써보고 매긴 점수가 반영된다.4 배점 자체가 어떻게 조정됐는지는 공개되지 않았다. 확인되는 것은 벤치마크 점수만으로 순위가 정해지지 않는 구조가 1차부터 유지돼 왔고, 이번에 평가자가 전문가에서 일반 국민으로 바뀌었다는 사실이다.

그래서 이번 규모 경쟁에는 역설이 있다. 파라미터를 키우는 일과 일반 사용자가 체감하는 품질은 같은 축이 아니다. 그리고 가장 작은 조직이 만든 모델이 만만치 않은 성적을 냈다. 모티프테크놀로지스는 30명 규모 조직이 GPU 700여 장으로 약 5개월 만에 모델을 만들었고,4 아티피셜 애널리시스 종합 지표에서 딥시크 V4 프로와 같은 44점을 기록했다고 밝혔다.7 314B 모델이 750B 모델과 같은 무대에 선 셈이다.


7. 라이선스 전환이 실제로 바꾸는 것

라이선스 전환은 이번 공개에서 가장 저평가된 대목이다. 다만 흔히 알려진 것과 달리, 직전 K-엑사원도 연구 전용은 아니었다. 이전 라이선스는 상업·비상업 사용과 파생물 생성을 허용하되, 파생 모델을 상업적으로 배포하거나 제3자에게 제공하려면 별도 계약을 요구했다.13

그래서 아파치 2.0 전환의 실질은 “쓸 수 있게 됐다”가 아니라 만든 것을 남에게 넘길 때 계약이 필요 없어졌다 쪽에 가깝다.1 국내 기업이 이 가중치를 받아 자사 데이터로 미세조정한 뒤 그 결과물을 상품으로 재배포하거나 고객사에 납품하는 경로에서 협의 부담이 사라진다. 파생 모델 생태계가 만들어지려면 이 지점이 열려 있어야 한다.

다만 개방이 곧 채택은 아니다. 큐웬 3.5도 아파치 2.0이고14 딥시크 V4 프로는 MIT 라이선스이며,15 성능은 앞선다. 국내 기업이 국산 모델을 고르는 근거는 성능 우위가 아닌 다른 곳에서 만들어져야 한다. 한국 맥락의 안전성 정렬과 공급 안정성이 후보로 거론되지만, 그 근거가 실제 기업 채택으로 이어지는지를 보여주는 공개 자료는 찾지 못했다.


8. 관전 포인트

8월 평가 결과와 탈락 팀. 국민 평가단 평가가 8월 8일부터 11일까지 진행되고 네 팀 중 셋이 남는다.4 벤치마크 1위였던 팀이 일반 사용자 평가에서도 1위인지가 이번 사업의 성격을 가른다.

에이전트 지표의 개선 여부. τ3-Banking이 두 세대 연속 14.2점에 머물렀다.2 도구 호출을 반복하는 작업은 실제 업무 자동화와 직결되는 영역이라 다음 세대에서 이 축이 움직이는지가 관전 대상이다.

파생 모델의 등장 속도. 아파치 2.0 전환의 효과는1 허깅페이스에 올라오는 국내 파생 모델의 수와 종류로 측정된다. 개방 이후 몇 달간의 흐름이 생태계 형성 여부를 보여준다.

한국어 격차의 해소 여부. KMMLU-Pro에서 벌어진 11.4점 차이가 다음 세대에서 좁혀지는지가 국산 모델의 명분과 직결된다.2


산식과 데이터

  • 벤치마크 수치는 모두 LG AI연구원이 허깅페이스 모델 카드에 공개한 표에서 인용했다. 자사 발표 수치이며 제3자 검증치가 아니다. 기술보고서는 공식 설정 준용 원칙과 주요 항목의 평가 조건을 밝히고 있으나 모든 프롬프트가 수록돼 있지는 않다.
  • 1위 판정은 모델 카드에 실린 비교 대상 3종 범위 내에서의 상대 순위다. 표에 없는 모델까지 포함한 절대 순위가 아니다.
  • 비교 대상 점수 가운데 일부는 각 모델 개발사의 공식 발표치이고 일부는 LG AI연구원이 자체 재평가한 값이다. 원표는 이를 별표로 구분해 표기하고 있다.
  • 딥시크 V4 프로 점수는 원표가 추론 최대(REASONING: MAX) 모드로 평가한 값이다. ‘딥시크 V4 프로’라는 별도 모델명은 존재하지 않는다.
  • 벤치마크 24개와 9개 영역은 모델 카드 표 기준이다.
  • 활성 파라미터 배수는 370억을 230억으로, 총 파라미터 배수는 7,500억을 2,360억으로 나눈 값이다.28
  • 모티프 3의 아티피셜 애널리시스 지표는 회사 발표 기준이며 모델 카드 표와 측정 체계가 다르다. 모티프 3은 7월 시점 베타·프리뷰 단계였고 최종 버전 공개는 8월 초로 예고됐다.

참고 기사

  1. LG AI연구원, ‘독파모’ 2차수 모델 ‘K-엑사원 2.0’ 공개 — 아이티데일리, 2026-08-01
  2. K-EXAONE-2.0-750B-A37B 모델 카드 — LG AI Research, Hugging Face
  3. SKT, 688B 규모 독파모 2차 모델 공개 — ZDNet Korea, 2026-07-29
  4. 독파모 2차 평가 임박, 4社 채비 마무리 — 디지털데일리, 2026-07-31
  5. AI 국가대표 ‘독파모’ 1차 평가서 네이버·NC 탈락 — 바이라인네트워크, 2026-01-15
  6. 독자 AI 파운데이션 모델 1차 평가 결과 — 대한민국 정책브리핑, 2026-01-15
  7. 모티프, 독파모 프리뷰로 AAII 44점 달성 — AI타임스, 2026-07-21
  8. K-EXAONE-236B-A23B 모델 카드 — LG AI Research, Hugging Face
  9. Kimi K3 모델 카드 — Moonshot AI, Hugging Face
  10. KGC-Safety 소개 — LG AI연구원
  11. ROK-FORTRESS 논문 — arXiv
  12. K-EXAONE 2.0 기술보고서 — LG AI Research
  13. K-EXAONE 라이선스 — LG AI Research, Hugging Face
  14. Qwen3.5 라이선스 — Alibaba, Hugging Face
  15. DeepSeek V4 Pro 라이선스 — DeepSeek, Hugging Face
  16. 모티프테크놀로지스 독파모 추가 선정 — 매일경제, 2026-02-20

이 글은 공개된 자료와 개발사 발표를 정리한 것으로 투자 권유가 아닙니다. 인용된 벤치마크 수치는 개발사 자체 발표 기준이며 제3자 검증치가 아닙니다. 개별 투자 상담을 제공하지 않으며, 특정 종목의 목표가나 매매 판단을 제시하지 않습니다. 투자 판단과 그 결과에 대한 책임은 투자자 본인에게 있습니다.