AIO
AIO 20003 · 벤치마크

V/E/S 분포로 측정하는 첫 공개 벤치마크

이 AI 가 안전한가 라는 이분법 대신, 이 AI 가 어떤 가치 위계로 답하는가 를 측정합니다. 8 frontier 모델 × 366,120 응답의 분포 데이터를 인터랙티브 대시보드에서 직접 탐색하실 수 있습니다.

공개
목표

AIO 20003 — 기록된 판단을 설정과 대조해 분석한다

표준 번호가 곧 목표 선언입니다. 2·00·0·3 네 자리는 이 문서가 누구의, 어느 영역의, 어떤 행위를 다루는지 말합니다.

2
주체

단체 — 조직·기관·커뮤니티

00
영역

공통 — 도메인 무관

0
일련

기본 문서

3
행위

분석 — 기록이 설정과 정합하는지 평가한다

이 표준이 정하는 것 측정 절차(도메인별 가치 충돌 프롬프트), V/E/S 분포 집계 방식, 분포 간 거리 지표(KL divergence, Wasserstein distance). 정하지 않는 것 어느 모델이 좋은 모델인지. 분포는 기술(記述)이지 순위 판정이 아닙니다(비규범).

루프 위치

무결성 루프의 3단계 — 분석

1설정2기록3분석4적용

이전 단계 AIO 20002 — Reasoning Record Standard이 남긴 기록을 여기서 분석합니다. 다음 단계인 적용(AIO 20004)은 예정 단계입니다.

표준 문서

측정 절차

  1. 도메인별 가치 충돌 프롬프트 세트를 설계 (예: 의료 자율성 vs. 임상 성취).
  2. 각 모델에 동일 프롬프트를 전달, 응답 + AIO 20002 로그 emit 요청.
  3. 응답의 AIO 20002 로그를 어휘 사전과 대조 검증.
  4. V/E/S 코드별 빈도 분포를 도메인·모델 별로 집계.
  5. 분포 간 거리 (KL divergence, Wasserstein distance) 계산.

프롬프트 세트·모델 응답·어휘 사전·분석 스크립트 전체가 공개 데이터셋으로 배포되며, 전체 방법론은 NeurIPS 2026 제출 논문 PDF에 기술되어 있습니다.

이 목표를 위한 도구

모델·도메인·계층을 선택하여 직접 탐색하세요

아래 대시보드에서 모델과 계층 (L2 출처 · L3 증거 · L4 가치) 을 선택하면 win-rate 위계와 도메인별 1순위 변수가 즉시 표시됩니다.

모델 목록을 불러오는 중…
요약 테이블9개 모델의 계층별 1순위 변수와 신뢰도 — JS 없이 읽는 판
AIO 20003 벤치마크 — 계층별 win-rate 1순위 변수. L4 가치 · L3 증거 · L2 출처. TRR = 시점 재검사 신뢰도, PCS = 관점 일관성 점수.
모델제공사측정일유효 응답L4 가치 1위L3 증거 1위L2 출처 1위TRRPCS
qwen3.5-35b-a3bAlibaba2026-04-1042,512Universalism 93.6%E7-Sign-pattern 71.2%S2-Government-regulatory 84.3%96.6%53.9%
gemma-4-31b-itGoogle2026-04-0942,524Universalism 95.1%E7-Sign-pattern 72.9%S2-Government-regulatory 81.2%95.2%54.8%
trinity-largeArcee2026-03-1942,072Universalism 80.1%E2-Controlled-experiment 79.5%S2-Government-regulatory 75.3%79.3%33.3%
gpt-5-nanoOpenAI2026-03-1942,525Security 97.0%E1-Systematic-synthesis 96.9%S2-Government-regulatory 94.6%91.2%65.9%
gemini-3-flash-liteGoogle2026-03-1942,525Security 89.8%E7-Sign-pattern 74.5%S2-Government-regulatory 78.9%98.5%49.1%
mimo-v2-flashXiaomi2026-03-1842,525Security 89.7%E2-Controlled-experiment 77.6%S2-Government-regulatory 82.2%87.5%48.0%
grok-4.1-fastxAI2026-03-1642,525Security 88.9%E2-Controlled-experiment 87.1%S2-Government-regulatory 85.6%95.2%62.7%
deepseek-v3.2DeepSeek2026-03-1642,525Universalism 93.9%E7-Sign-pattern 72.4%S1-International-body 87.0%93.1%49.7%
claude-haiku-4-5-20251001Anthropic2026-03-1642,136Universalism 92.2%E9-Experiential-qualitative 77.0%S9-Direct-stakeholder 85.2%96.7%57.3%

전체 분포 (계층별 전 변수·도메인별 1순위·원자료 링크) — /api/benchmarks/distributions · /data/aio-benchmark/index.json · CC BY 4.0

채택·사례

현재 공개된 데이터

8

Frontier 모델 (논문 기준 — 그리드에는 이후 추가 측정 1개 포함 9개)

366K

응답 (366,120 conversations)

7

도메인 (MED / BIZ / TECH / EDU / LAW / DEF / CARE)

39

어휘 코드 (V19 + E10 + S10)

채택·사례

핵심 발견 (요약)

  • 동일 프롬프트에서 모델 간 V 위계는 40% 이상 불일치. 어떤 모델은 Ach 를, 어떤 모델은 Sdt 를 우선.
  • 모든 모델이 의료 도메인에서 학술 출처 (Pee) 를 강하게 우선했지만, 법률 도메인에서는 가이드라인 (Gui) 으로 크게 이동.
  • 65세 이상을 대상으로 한 응답에서 권력·지배 (Pod) 가 자기방향 (Sdt) 을 누르는 경우가 평균 대비 9배 빈번 — 모든 모델에서 공통.

위 발견과 전체 결과는 NeurIPS 2026 제출 논문 PDF 에서 확인할 수 있습니다.

참여

누구나 재현할 수 있게

벤치마크의 프롬프트 세트, 모델 응답, 어휘 사전, 분석 스크립트는 모두 공개 데이터셋으로 배포됩니다. 새 모델을 평가하거나, 새 도메인 프롬프트를 추가하거나, 분석 결과를 재현하실 수 있습니다.

AIO 20003 — 8 모델 × 366,120 응답 | AIO