🎙️ Open Ko-S2S Leaderboard

한국어 저지연 Talk Mode 전용 리더보드

ASR + LLM + TTS + 감정 + 끼어들기(barge-in) + 업무 성공률을 한 번에 측정합니다. "한국어 1:1 상담원 체감 성능"을 단일 Talk Score로 비교하세요.

기존 공개 리더보드(OpenKoASR · KoALa-Bench · Artificial Analysis S2S/STT/TTS · Open Ko-LLM)는 차원별로 쪼개져 있습니다. 이 리더보드는 그 빈틈 — 음성 대 음성(end-to-end) 한국어 대화 체감 성능 — 을 통합해 채웁니다.

모든 수치는 RTX 4090에서 직접 실측한 값입니다. (예시/seed 데이터 제거) 아직 측정하지 않은 차원은 빈칸이며, 측정 컬럼(n/7)이 실측된 차원 수를 보여줍니다. ☁️ 미측정 cloud/API 모델(GPT·Gemini·Clova 등)은 실측 전까지 노출하지 않습니다.

배포 환경 — 🖥️ 로컬(GPU 직접 구동) vs ☁️ 클라우드(API)

⚖️ 지연·비용은 같은 배포 환경 안에서만 비교하세요. 로컬 GPU 추론 지연과 클라우드 API의 voice-to-voice 지연은 하드웨어·네트워크가 달라 직접 비교가 무의미합니다.

📏 ASR 실측 벤치마크(검증 ✅ 항목): Zeroth-Korean test (457문장) · CER 공백제거(space-free) 동일 프로토콜 · 측정환경 RTX 4090. ⚠️ Zeroth로 파인튜닝된 모델은 이 셋에서 홈그라운드 이점이 있어 base 모델과 직접 비교 시 별도 표기(held-out 셋 권장).

구조
공개
300 2000

정렬 기준: Talk Score (내림차순). 표 헤더 클릭으로 재정렬. 측정 컬럼 = 7개 차원 중 실측된 수 — 1/7은 해당 차원만 쟀다는 뜻이며 Talk Score는 측정된 차원만으로 재정규화된 값입니다(부분 측정 주의). 모델명 뒤 * = 평가셋(Zeroth)으로 학습된 in-domain 모델 — base 모델보다 홈그라운드 이점이 있어 직접 비교 시 주의.

🎧 ASR 모델의 실제 전사를 음성으로 듣고 비교하려면 → Korean ASR Arena

⏱️ 저지연 컬럼: 🖥️ 로컬 단일 컴포넌트(ASR/LLM/TTS)는 모델 추론 지연(4090, 중앙값), Cascade·전체 시스템은 voice-to-voice(입→귀). 의미가 다르니 같은 종류끼리 비교하세요.