Palette
— 서울
놀이터 →

K-DECIDE

한국어 의사결정 벤치마크

같은 800개 한국어 문항, 같은 스키마, 같은 라벨 공간. 문항은 손대지 않고 그대로 두 모델에 보냈습니다. 이긴 것도 진 것도 그대로 싣습니다.

Jev 1.13.0 · 2026-09-21 · harness/jev.py

전체 일치율 · 자체 보류 세트 800문항 · 학습에 쓰이지 않은 대조쌍

Gyeol v2b · 맥니마 p=0.29 (동률 이상)

질문 유형별 — 여기서 갈립니다

참/거짓 p=0.11 · 선택형 p=0.77 · 척도 p=0.60

보정 · 속도 · 제공 형태

모델일치율ECE ↓Brier ↓지연 p50제공
Gyeol v2b · 7.3B0.87250.05790.101824 msAPI
Gyeol v2 · 7.3B0.86500.03820.103424 msAPI
Jev 1.13.00.85500.03610.0973339 msAPI
Gyeol v1 · 7.3B0.84000.03060.116624 msAPI
Qwen3.8-27B 학습 전0.89880.03070.0749103 ms공개 기반 모델
A.X-4.0-Light 학습 전0.67000.27840.301614 ms공개 기반 모델

지연은 성격이 다른 두 숫자입니다. Gyeol은 H100 한 장에서 잰 모델의 시간, Jev는 API까지 왕복한 시간. 같은 자가 아니므로 나란히 놓되 그대로 비교하지는 마세요.

남은 약점 — 감추지 않습니다

척도는 아직 수치상 Jev가 앞섭니다 (0.812 대 0.779, p=0.60). 데이터 3배와 순서를 아는 손실 함수로 0.721에서 0.779까지 왔고, 그 대가로 보정 오차가 0.038에서 0.058로 올랐습니다. 온도 보정으로 되돌리는 중입니다.

선택지 순서를 뒤집었을 때 답이 바뀌는 비율: 학습 전 27% → v1 22% → v2b 20%. Jev는 13~14%.

v3: 척도 전용 14,000 시드 · 순열 3개 · 온도 보정

공개 한국어 세트 8,316문항 · 유형별

척도에서는 우리가 크게 앞섭니다. 0.403 대 0.237. KLUE-STS는 0부터 5까지 여섯 단계의 진짜 순서 척도입니다. Jev는 찍는 수준(0.167)을 겨우 넘습니다. 긴급도·위험도·만족도처럼 순서가 있는 판단이 본체라면, 이 열이 가장 중요합니다.

출처별 · KoBEST · KLUE · Belebele-ko · PAWS-X

출처nJev 1.13Gyeol 계열
KoBEST BoolQ10000.9810.951Jev
KoBEST COPA10000.9800.958Jev
KoBEST SentiNeg3970.9650.967동률
KoBEST WiC10000.8900.761Jev
KoBEST HellaSwag5000.7860.852Gyeol
KLUE YNAT10000.7550.779Gyeol
KLUE NLI10000.9330.906Jev
KLUE STS · 척도5190.2370.403Gyeol +0.166
Belebele-ko9000.9410.913Jev
PAWS-X-ko10000.7340.713Jev
전체83160.8440.820Jev

측정 도구부터 확인했습니다. 한국 연구자가 9월 17일에 공개한 Jev 한국어 측정값은 Belebele-ko 96/100, PAWS-X-ko 76/100(n=100, 오차 ±8). 저희 하네스는 같은 세트를 9~10배 규모로 재서 0.941과 0.734를 얻었습니다. 둘 다 그 오차 안입니다 — 이 표의 Jev 숫자는 만든 것이 아니라 재현된 것입니다.