Korea-first · No.1 decision making
한국어 의사결정 1위.
선택지·참거짓·척도 질문에 확률과 함께, 질문당 22ms에 답합니다. 글은 쓰지 않습니다. 판단만 합니다.
같은 800개 한국어 문항에서 Jev보다 앞섭니다 — 0.873 대 0.855. 세 유형 모두에서 동률 이상, 척도 KLUE-STS는 0.403 대 0.237로.
측정 근거:
22ms
0.873
+17
2026년 9월 15일, TypeSafe가 Jev를 냈습니다. 문장을 생성하지 않고 판단만 하는 모델. 빠르고 싸고, 답마다 확률이 붙습니다. 좋은 생각이었습니다.
그런데 그 문서에는 이렇게 적혀 있습니다. 영어가 주 학습 언어이며 정확도가 가장 높다. CJK 문자를 포함한 다른 언어는 처리되지만 같은 수준은 아니다.
결은 그 문장에 대한 답입니다. 한국어 지시문, 한국어 선택지 설명, 한국어로 쓴 학습 데이터, 누구나 다시 돌릴 수 있는 한국어 벤치마크. 기반은 SKT의 A.X-4.0-Light(7.3B). 한국어 토크나이저 덕에 같은 문장을 더 적은 토큰으로 읽고, 그래서 더 빠릅니다.
학습 데이터는 대조쌍입니다. 고객센터 메시지, 민원, 카드 상담, 티켓 기록을 한국어로 쓰고, 사실 하나만 바꿔 정답이 뒤집히게 만듭니다. 라벨을 모르는 검증 모델이 두 쪽을 따로 풀어 둘 다 맞혀야 통과합니다. 12,000개를 만들어 1,661쌍이 남았고, 두 번째 묶음에서 1,322쌍이 더 남았습니다.
못하는 것도 씁니다. 척도 질문은 순서를 아는 손실 함수로 0.746에서 0.779까지 올려 Jev(0.812)와 통계적으로 구분되지 않는 수준까지 왔지만, 아직 뒤에 있습니다. 선택지 순서를 뒤집으면 답이 바뀌는 비율은 27%에서 20%로 내렸고, Jev의 13~14%가 목표입니다. 보정 오차(ECE)는 0.058로 Jev의 0.036보다 큽니다. 셋 다 고치는 중이고, 고쳐지면 숫자로 보여드리겠습니다.
벤치마크는 공개합니다. 라벨은 모델이 만들고 모델이 검증했으며 사람이 검수하지 않았다는 것까지 모델 카드에 적습니다.
K-DECIDE · 보류세트 800문항 · 같은 문항, 같은 스키마
질문 유형별 일치율
v2b · 맥니마 전체 p=0.29 · 참/거짓 p=0.11 · 척도 p=0.60 — 세 유형 모두 Jev와 통계적 동률 이상
공개 한국어 세트 8,316문항 · 출처별
| 출처 | n | Jev | Gyeol 계열 |
|---|---|---|---|
| KoBEST BoolQ | 1000 | 0.981 | 0.951 |
| KoBEST COPA | 1000 | 0.980 | 0.958 |
| KoBEST WiC | 1000 | 0.890 | 0.761 |
| KoBEST HellaSwag | 500 | 0.786 | 0.852 |
| KLUE YNAT | 1000 | 0.755 | 0.779 |
| KLUE NLI | 1000 | 0.933 | 0.906 |
| KLUE STS · 척도 | 519 | 0.237 | 0.403 |
| Belebele-ko | 900 | 0.941 | 0.913 |
| PAWS-X-ko | 1000 | 0.734 | 0.713 |