Palette
— 서울
시작하기 →

Gyeol · Palette결

Korea-first · No.1 decision making

한국어 의사결정 1위.
선택지·참거짓·척도 질문에 확률과 함께, 질문당 22ms에 답합니다. 글은 쓰지 않습니다. 판단만 합니다.

놀이터에서 바로 써보기→

같은 800개 한국어 문항에서 Jev보다 앞섭니다 — 0.873 대 0.855. 세 유형 모두에서 동률 이상, 척도 KLUE-STS는 0.403 대 0.237로.

측정 근거:

KoBESTKLUEBelebelePAWS-XK-DECIDE

판단만
합니다.

의사결정

22ms

질문당 지연 · H100 한 장 · 네 질문을 한 번에 89ms

0.873

보류세트 일치율 · Jev 0.855 · 같은 800문항

+17

척도(KLUE-STS)에서 Jev 대비 앞선 포인트 · 0.403 대 0.237

2026년 9월 15일, TypeSafe가 Jev를 냈습니다. 문장을 생성하지 않고 판단만 하는 모델. 빠르고 싸고, 답마다 확률이 붙습니다. 좋은 생각이었습니다.

그런데 그 문서에는 이렇게 적혀 있습니다. 영어가 주 학습 언어이며 정확도가 가장 높다. CJK 문자를 포함한 다른 언어는 처리되지만 같은 수준은 아니다.

결은 그 문장에 대한 답입니다. 한국어 지시문, 한국어 선택지 설명, 한국어로 쓴 학습 데이터, 누구나 다시 돌릴 수 있는 한국어 벤치마크. 기반은 SKT의 A.X-4.0-Light(7.3B). 한국어 토크나이저 덕에 같은 문장을 더 적은 토큰으로 읽고, 그래서 더 빠릅니다.

학습 데이터는 대조쌍입니다. 고객센터 메시지, 민원, 카드 상담, 티켓 기록을 한국어로 쓰고, 사실 하나만 바꿔 정답이 뒤집히게 만듭니다. 라벨을 모르는 검증 모델이 두 쪽을 따로 풀어 둘 다 맞혀야 통과합니다. 12,000개를 만들어 1,661쌍이 남았고, 두 번째 묶음에서 1,322쌍이 더 남았습니다.

못하는 것도 씁니다. 척도 질문은 순서를 아는 손실 함수로 0.746에서 0.779까지 올려 Jev(0.812)와 통계적으로 구분되지 않는 수준까지 왔지만, 아직 뒤에 있습니다. 선택지 순서를 뒤집으면 답이 바뀌는 비율은 27%에서 20%로 내렸고, Jev의 13~14%가 목표입니다. 보정 오차(ECE)는 0.058로 Jev의 0.036보다 큽니다. 셋 다 고치는 중이고, 고쳐지면 숫자로 보여드리겠습니다.

벤치마크는 공개합니다. 라벨은 모델이 만들고 모델이 검증했으며 사람이 검수하지 않았다는 것까지 모델 카드에 적습니다.

K-DECIDE · 보류세트 800문항 · 같은 문항, 같은 스키마

질문 유형별 일치율

v2b · 맥니마 전체 p=0.29 · 참/거짓 p=0.11 · 척도 p=0.60 — 세 유형 모두 Jev와 통계적 동률 이상

공개 한국어 세트 8,316문항 · 출처별

출처nJevGyeol 계열
KoBEST BoolQ10000.9810.951
KoBEST COPA10000.9800.958
KoBEST WiC10000.8900.761
KoBEST HellaSwag5000.7860.852
KLUE YNAT10000.7550.779
KLUE NLI10000.9330.906
KLUE STS · 척도5190.2370.403
Belebele-ko9000.9410.913
PAWS-X-ko10000.7340.713
전체 벤치마크와 방법→

무료

₩0/월

종량

₩60/백만 입력 토큰

팀

₩490,000/월

엔터프라이즈

문의
이야기 나누기→