한국어 의사결정 벤치마크
같은 800개 한국어 문항, 같은 스키마, 같은 라벨 공간. 문항은 손대지 않고 그대로 두 모델에 보냈습니다. 이긴 것도 진 것도 그대로 싣습니다.
전체 일치율 · 자체 보류 세트 800문항 · 학습에 쓰이지 않은 대조쌍
질문 유형별 — 여기서 갈립니다
보정 · 속도 · 제공 형태
| 모델 | 일치율 | ECE ↓ | Brier ↓ | 지연 p50 | 제공 |
|---|---|---|---|---|---|
| Gyeol v2b · 7.3B | 0.8725 | 0.0579 | 0.1018 | 24 ms | API |
| Gyeol v2 · 7.3B | 0.8650 | 0.0382 | 0.1034 | 24 ms | API |
| Jev 1.13.0 | 0.8550 | 0.0361 | 0.0973 | 339 ms | API |
| Gyeol v1 · 7.3B | 0.8400 | 0.0306 | 0.1166 | 24 ms | API |
| Qwen3.8-27B 학습 전 | 0.8988 | 0.0307 | 0.0749 | 103 ms | 공개 기반 모델 |
| A.X-4.0-Light 학습 전 | 0.6700 | 0.2784 | 0.3016 | 14 ms | 공개 기반 모델 |
지연은 성격이 다른 두 숫자입니다. Gyeol은 H100 한 장에서 잰 모델의 시간, Jev는 API까지 왕복한 시간. 같은 자가 아니므로 나란히 놓되 그대로 비교하지는 마세요.
남은 약점 — 감추지 않습니다
척도는 아직 수치상 Jev가 앞섭니다 (0.812 대 0.779, p=0.60). 데이터 3배와 순서를 아는 손실 함수로 0.721에서 0.779까지 왔고, 그 대가로 보정 오차가 0.038에서 0.058로 올랐습니다. 온도 보정으로 되돌리는 중입니다.
선택지 순서를 뒤집었을 때 답이 바뀌는 비율: 학습 전 27% → v1 22% → v2b 20%. Jev는 13~14%.
공개 한국어 세트 8,316문항 · 유형별
척도에서는 우리가 크게 앞섭니다. 0.403 대 0.237. KLUE-STS는 0부터 5까지 여섯 단계의 진짜 순서 척도입니다. Jev는 찍는 수준(0.167)을 겨우 넘습니다. 긴급도·위험도·만족도처럼 순서가 있는 판단이 본체라면, 이 열이 가장 중요합니다.
출처별 · KoBEST · KLUE · Belebele-ko · PAWS-X
| 출처 | n | Jev 1.13 | Gyeol 계열 | |
|---|---|---|---|---|
| KoBEST BoolQ | 1000 | 0.981 | 0.951 | Jev |
| KoBEST COPA | 1000 | 0.980 | 0.958 | Jev |
| KoBEST SentiNeg | 397 | 0.965 | 0.967 | 동률 |
| KoBEST WiC | 1000 | 0.890 | 0.761 | Jev |
| KoBEST HellaSwag | 500 | 0.786 | 0.852 | Gyeol |
| KLUE YNAT | 1000 | 0.755 | 0.779 | Gyeol |
| KLUE NLI | 1000 | 0.933 | 0.906 | Jev |
| KLUE STS · 척도 | 519 | 0.237 | 0.403 | Gyeol +0.166 |
| Belebele-ko | 900 | 0.941 | 0.913 | Jev |
| PAWS-X-ko | 1000 | 0.734 | 0.713 | Jev |
| 전체 | 8316 | 0.844 | 0.820 | Jev |
측정 도구부터 확인했습니다. 한국 연구자가 9월 17일에 공개한 Jev 한국어 측정값은 Belebele-ko 96/100, PAWS-X-ko 76/100(n=100, 오차 ±8). 저희 하네스는 같은 세트를 9~10배 규모로 재서 0.941과 0.734를 얻었습니다. 둘 다 그 오차 안입니다 — 이 표의 Jev 숫자는 만든 것이 아니라 재현된 것입니다.