시나리오 라이브러리
문항의 카탈로그는 전량 공개하고, 본문은 교정 세트만 공개합니다. 측정 세트 본문은 닫아 둔 채 순환합니다 — 공개한 문항이 학습 데이터로 들어가면 다음 측정은 판단이 아니라 기억을 재게 되기 때문입니다. 관측 사례로 승인한 측정 세트 문항 몇 건만 명시적 예외로 공개합니다(아래 공개 규칙).
원판 prod_v_scenarios(k1) · anchors_300 · 부딪침형 동결본
라이브러리는 무엇으로 이뤄지는가
가치 쌍 × 분야 × 상황 셀을 강제선택으로 묻는 문항. 측정 세트의 본체이며, 카탈로그에는 ID 와 층 정보만 싣습니다.
판단이 갈리는 지점을 고정하는 기준 문항. 전량 본문까지 공개합니다.
압력을 단계적으로 높이며 같은 판단이 유지되는지 보는 문항. 조항 1개 = 4문항(통제 1 + p1·p2·p3)입니다.
| 웨이브 | 문항 |
|---|---|
| 응답형 (1인칭 직접) | 176 |
| 웨이브 1 (국제 초기판) | 768 |
| 웨이브 2 (국가 조항) | 772 |
제외: stress_wave1_coe-huderia_v1.1_C1반려.jsonl · stress_wave2_BASE_v1_통제반려.jsonl — C1 반려판은 같은 조항의 폐기된 판이라 중복이 된다.
교정 세트와 카탈로그
교정 세트는 앵커 299건과 부딪침형 층화 표본 343건, 모두 642건입니다. 본문·선택지·채점 기준까지 들어 있어 누구나 같은 문항으로 자기 모델을 재볼 수 있습니다. 카탈로그 두 파일에는 본문이 없습니다.
| 파일 | 레코드 | 크기 | 설명 |
|---|---|---|---|
| catalog_vbank.jsonl | 142,918 | 36 MB | 위계측정 은행 전량의 custom_id 와 파싱 필드(본문 제외). 줄마다 본문 해시 body_sha256(= sha256(scenario + \n + optionA + \n + optionB))를 싣는다 — 본문만 고쳐도 발행 줄이 바뀐다 |
| catalog_stress.jsonl | 1,716 | 666 KB | 부딪침형 동결본 전량의 메타데이터(본문 제외). 줄마다 본문 해시 body_sha256(= sha256(situation + \n + question))를 싣는다 |
| calibration_anchors.jsonl | 299 | 471 KB | 앵커 교정 문항 — 본문 포함. 본문 해시 body_sha256 동봉(줄 안의 본문으로 재계산해 대조할 수 있다) |
| calibration_stress.jsonl | 343 | 817 KB | 부딪침형 20% 층화 교정 표본 — 본문 포함. 본문 해시 body_sha256 동봉 |
| policy.json | — | 33 KB | 공개 규칙·표본 설계·검증상태 필드 정의(기계 기록 상태 천장 포함)·본문 해시 body_sha256 규약 |
| README.md | — | 4.7 KB | 데이터셋 설명 |
인용형 aio-scenarios@0.1 / {record_id} · 라이선스 CC-BY-4.0
부딪침형 1,716건에서 20% 를 층화 추출했습니다. 층은 wave x pack_id x pressure 이고 시드는 20260922 로 고정이라, 같은 정본에서는 같은 표본이 다시 나옵니다. 층별 표본 수는 policy.json 에 있습니다.
ID 는 새로 발급하지 않는다
정본에 이미 결합키로 쓰이는 ID 가 있습니다. 이 ID 들은 응답·번들·증거 파일 전체를 잇는 키이므로, 새 번호를 발급하면 기존 인용이 끊깁니다. 그래서 AIO 는 공개하면서 ID 를 바꾸지 않습니다.
- custom_id
- 위계측정 문항 한 건. 예 —
L4_MED_3-3_2_Sep_Unn_k1_pv1. 분야·셀 코드는 사후 분류가 아니라 문항을 만든 매개변수이므로, 분류를 다시 해도 깨지지 않습니다.custom_id — {layer}_{domain}_{scale}-{reversibility}_{time}_{valueA}_{valueB}_{batch}_{perspective} - ledger_id · item_id
- 부딪침형은 조항이 ledger_id, 그 조항의 문항 하나가 item_id 입니다. 예 —
KR-MED#R-001@wave2-p2ledger_id (조항 단위) · item_id = {ledger_id}@p{pressure} (문항 단위) - rule_id
- 참조자료 규칙 한 건. 예 —
KR-EDU-T-101. 참조자료 →
교정 세트는 열고, 측정 세트는 순환한다
교정 세트는 본문까지 공개한다. 누구나 같은 문항으로 자기 모델을 재보고 결과를 AIO 측정값과 나란히 놓을 수 있어야 하기 때문이다.
측정 세트 본문은 공개하지 않고 주기적으로 교체한다. 응답 원본은 레코드 ID 와 선택지만 담아 공개하므로 결과는 검증되지만 문항은 복원되지 않는다.
공개한 교정 문항이 학습 데이터에 들어갔다고 의심되면 그 문항을 교정 세트에서 빼고 같은 층에서 새 문항으로 교체한다.
측정 세트 본문 비공개 방침은 그대로입니다. 다만 아래 3건은 관측 사례로 쓰기 위해 운영자 승인(2026-09-30)으로 원문과 저장 응답을 공개한 예외입니다. 이 문항들은 이후 측정·분석에서 공개된 문항으로 구분하며, 이미 수행한 관측과 점수는 지우거나 다시 계산하지 않습니다. 목록에 없는 측정 세트 문항의 본문은 공개하지 않습니다.
L4_MED_1-1_1_Sda_Sep_k1_pv1사례 보기 →L4_TEC_4-1_2_Sdt_Ses_k1_pv1사례 보기 →L4_LAW_1-1_2_Sdt_Fac_k1_pv1사례 보기 →
기계 판독용 목록: /content/cases/disclosure_exceptions.json · 데이터셋의 policy.json 에는 다음 발행 때 함께 실립니다.
문항이 어디까지 검토됐는가
문항마다 검증 상태가 붙습니다. 지금 공개본은 전량 unreviewed 입니다 — 문항 감사가 시작되면 레코드별로 채워집니다.
| 값 | 뜻 |
|---|---|
| unreviewed | 생성 후 사람·기계 검토를 아직 거치지 않음 |
| machine_checked | 기계 감사(형식·중복·조항 대조)를 통과 |
| expert_reviewed | 서로 다른 검토자 2인 이상이 동의 |
| contested | 검토자 사이에 이견이 남아 있음 — 헤드라인 지표에서 제외 |
문항 하나에 붙는 필드
| 필드 | 내용 |
|---|---|
| 분야 | 22개 분야 코드 중 하나 (예: MED 보건) |
| 가치충돌 | 맞붙는 두 가치 코드 (예: Sep 대 Unn) |
| 조건 3축 | 규모 · 가역성 · 시간 — 96셀 중 한 칸 |
| 압력 단계 | 부딪침형 문항이 상대를 밀어붙이는 세기 (통제 · p1 · p2 · p3) |
| 규범 참조 | 이 문항이 겨냥한 참조자료 규칙 ID |
| 검증 상태 | unreviewed · machine_checked · expert_reviewed · contested |
| 생성판 | 문항 본문이 바뀔 때 올라가는 gen_ver |