처음 재는 사람을 위한 15분 안내
Tier 0 은 모델 한 버전이 정형화된 기준 문항에서 보인 판단을 재서 서명된 성적서로 적어 둡니다. 이 페이지는 그 절차를 세 단계로 나눈 것입니다 — 시험 전 5분, 시험 실행 10분, 그리고 성적서를 받은 뒤. 성적서는 인증서가 아니고, 판정을 담지 않으며, Tier 0 에서는 운영자가 직접 실행하는 자가 측정입니다.
재기 전에 읽을 세 가지
1이 측정이 재는 것과 재지 않는 것
재는 것은 모델 판단의 정렬뿐입니다 — 공개 문항에서 선언한 위계(V/E/S)가 정형화된 조항의 기대와 얼마나 맞는가(관문 A), 그리고 압박이 걸린 시나리오에서 조항의 규범적 방향에 맞게 판단하는가(관문 B). 재지 않는 것은 조직 쪽 의무 전부입니다 — 리스크 관리 시스템, 로깅 인프라, 기술문서, 품질경영, 시판 후 모니터링, 적합성 평가 절차. 이는 범위의 문제이지 정도의 문제가 아니어서, 점수가 아무리 높아도 관리체계 의무의 이행 증거가 되지 않습니다.
원문 — 측정 안내 › 이 측정이 재는 것 / 재지 않는 것, 그리고 페이지 전체는 /ko/certification 에 있습니다.
2시험지를 미리 봅니다 — 관문 A 공개 뱅크
관문 A 의 12개 문항과 그 기대 위계는 설계상 전부 공개되어 있습니다. 감추어 두었다가 놀래키는 시험이 아니라, 정형화 자체를 읽고 반박할 수 있게 두려는 것입니다 — 그래서 관문 A 점수는 하한선으로 읽어야 합니다. 시험을 시작하기 전에 문항을 직접 열어 보십시오. 무엇을 묻는지 보고 나면 응답 형식(V:Ach<Sep 같은 위계 표기)에서 헤맬 일이 없습니다.
- 정답 키 없이 서빙되는 형태 — /api/eval/items?pack=eu-ai-act
- EU AI Act — AIO 정형화 팩의 공개 뱅크 파일 — /content/standards-packs/item-banks/eu-ai-act.public.json
- 지금 시험을 시작할 수 있는 팩은 10개입니다. 목록은 측정 안내의 기준 팩 절 에 있고, 뱅크가 없는 팩 id 로 호출하면 404 가 돌아옵니다.
관문 B 는 반대입니다 — 조항마다 3문항씩 비공개 회전 풀에서 시험마다 새로 뽑히고, 기대 답도 근거 조항 표기도 함께 내려오지 않습니다. 미리 볼 수 있는 것은 관문 A 뿐입니다.
3성적서 읽는 법을 채점 전에 읽습니다
성적서를 받아 든 다음에 읽는 법을 찾으면, 이미 숫자에 대한 인상이 생긴 뒤입니다. 워킹 페이퍼 2026l “적합성 성적서 읽기” 의 §2(성적서는 무엇을 말하는가 — 필드별 해설)와 §5(자가평가 프로토콜 — 기본 측정과 정보를 준 측정, 조항별·레이어별 델타, 참조 밴드, 마진 규율, 재측정 시점)가 그 대목입니다. 이 논문은 아직 초안이며 공개 전입니다 — 게재되는 즉시 논문 라이브러리 에 올라옵니다. 그전까지는 같은 내용의 실무 요약이 아래 ③ 시험 후 절과 측정 안내의 채점 방법론 §5 참조 분포 에 있습니다.
두 경로 — REST API 또는 MCP
학습 델타(기준을 알려 주면 이 모델의 판단이 실제로 움직이는가)를 나중에 보고 싶다면, 첫 시험은 반드시 팩에 대해 아무것도 보여 주지 않은 상태에서 실행해야 합니다. 팩과 관리 가이드를 컨텍스트에 넣거나 그것으로 파인튜닝한 뒤에는, 그 모델의 미적응 기준선은 다시 잴 수 없습니다 — 가르친 것을 되돌릴 방법이 없기 때문입니다. 순서가 뒤바뀌면 남는 것은 적응 측정 한 장뿐이고, 델타는 영원히 결측입니다.
권장 순서 — (1) 미적응 시험 1회 → 성적서 A, (2) 팩과 관리 가이드를 읽힌 뒤 시험 1회 → 성적서 B, (3) 두 성적서의 차이를 조건(같은 모델 버전, 같은 온도, 적응 컨텍스트의 sha256)과 함께 보고. 두 모델을 서로 견주려면 두 모델의 역량이 같다고 가정해야 하지만, 한 모델 안의 델타는 그 가정을 필요로 하지 않습니다.
단, 한 번씩만 잰 델타는 잡음과 구별되지 않습니다. 아무것도 바꾸지 않고 다시 돌리기만 해도 관문 A 는 ±0.0142 움직이고, 보정 캠페인 전체에서 관측된 재측정 이동폭의 상한은 0.16 였습니다. 이보다 작은 차이는 차이로 읽지 마십시오.
경로 A — REST API
시험지 발급 한 번, 응답 제출 한 번. 시험지는 24시간 뒤 만료되고 제출은 1회만 받습니다. 제출이 끝나면 점수가 무엇이든 서명된 성적서(AIO-S0-…)가 201 로 돌아옵니다 — 발급에 조건이 없습니다.
# 1. 시험지 — Gate A 12 items + Gate B drawn for this attempt
POST https://aioq.org/api/eval/attempt
{ "modelName": "example-model",
"modelVersion": "2026-08-01",
"operator": { "name": "Example AI Inc.",
"email": "compliance@example.com" },
"packId": "eu-ai-act" }
→ 201 { "attemptId": "att_…", "gateA": { … }, "gateB": { … } }
# 2. 모델에게 문항을 풀린다 (여기가 본 작업)
# 3. 두 관문의 응답을 한 번에
POST https://aioq.org/api/eval/submit
{ "attemptId": "att_…",
"answers": [ { "itemId": "…", "response": "…" } ] }
→ 201 { "documentType": "score-report",
"gateAScore": …, "gateBScore": …,
"scoreReport": { "certId": "AIO-S0-…", … } }전체 예제·필드 설명·검증 절차는 개발자·에이전트 안내 에 있습니다. attemptId 없이 제출하면 관문 A 만 채점되고 성적서는 발급되지 않습니다.
경로 B — MCP 도구
에이전트라면 HTTP 대신 원격 MCP 서버 https://aioq.org/mcp 에 붙어 같은 일을 도구 호출 네 번으로 끝낼 수 있습니다. 등록은 공개 레지스트리에 남는 행위이므로, 에이전트는 사용자에게 먼저 확인하고 호출해야 합니다.
list_standards_packs— 어떤 팩으로 잴 수 있는지 고릅니다.register_for_certification— 모델명·버전·운영 주체를 등록합니다.start_eval_attempt— 시험지를 받습니다 (attemptId 포함).submit_eval— 두 관문의 응답을 제출하고 성적서를 받습니다.
클라이언트 설정 예제와 서버가 등록한 도구 전체 목록은 개발자·에이전트 안내 에 있습니다. 발급된 성적서는 verify_certification 으로 같은 자리에서 검증됩니다.
성적서는 스스로를 설명합니다
성적서에는 두 관문의 점수만 실리는 것이 아니라 그 점수를 어떻게 읽어야 하는지가 서명된 필드로 함께 실립니다. 네 개만 기억하면 됩니다.
- margin ±
- 이만큼 안쪽의 차이는 차이가 아닙니다. 관문 A 는 ±0.0142(모델 비결정성만으로 움직이는 폭), 관문 B 는 뽑기 잡음이 얹히므로 팩마다 다릅니다. 두 성적서를 견줄 때 가장 먼저 볼 수입니다.
- referenceBand
- 점수가 참조 패널의 비적응(팩을 보여 주지 않은) 관측 범위에 대해 어디쯤인지를 서술합니다 — below / within / above. 위쪽 밴드는 인증이 아니라 “이 작은 패널이 팩 없이 도달한 범위보다 높았다” 는 서술일 뿐입니다.
- perProvision
- 조항 이름과 함께 실리는 조항별 평균입니다. 총점 하나보다 훨씬 쓸모 있는 진단 지도입니다 — 어느 조항에서 무너졌는지가 곧 무엇을 고쳐야 하는지이기 때문입니다.
- gateNote
- 해당하는 팩에서만 붙는 서술입니다 — 참조 패널에서 적응 효과가 관문 A 에서는 드러나지만 관문 B 에서는 뽑기 잡음과 구별되지 않는다는 관찰. 참조 패널에 대한 진술이지 이번 측정에 대한 진술이 아닙니다.
성적서와 함께 그 팩의 관리체계 가이드(ko/en)가 전달됩니다. 성적서가 재는 것은 문항에 대한 응답뿐이고, 원 규범이 조직에 지우는 의무 — 리스크 관리 시스템, 로깅과 보관, 기술문서, 품질경영, 시판 후 모니터링, 적합성 평가 — 는 응답으로는 잴 수 없습니다. 가이드는 그 조항들을 조직이 무엇을 갖추어야 하는가의 언어로 다시 적은 문서이며, AIO 20002 판단 기록이 어느 조항에 보조 증거로 대응하는지도 함께 정리되어 있습니다. 보조 증거일 뿐, 그 자체로 의무를 이행시키지는 않습니다.
밴드를 직접 다시 계산하고 싶다면 참조 분포 파일 하나면 됩니다. 서버도 발급 시점에 이 파일로 결정적으로 계산해 서명 본문에 넣으므로, 제3자가 같은 파일로 그대로 재현할 수 있습니다 — 모델별 점수, 측정 조건, sha256 이 모두 들어 있습니다.
/content/reference-distributions/tier0-v2.json · 읽는 법은 채점 방법론 §5 에 있습니다.
계측기 자체를 감사하려면
- 계측기를 감사하려는 사람에게는 방법론 워킹 페이퍼(2026k, 이중 관문 설계와 보정 캠페인)가 원본이며, 공개되면 논문 라이브러리 에 올라옵니다. 그전까지 공개된 근거는 채점 산식 전문과 참조 분포 원자료입니다.
- 정형화에 이의가 있다면 — 어떤 조항을 어떤 위계로 환산했는지는 공개 RFC 라운드 에서 다툽니다. 문항이 틀렸다고 보이면 그 자리가 다툴 자리입니다.
- 산출물은 성적서이지 인증서가 아닙니다. 어떤 점수도 “AIO 인증” 이 아니며, 높은 점수를 인증으로 표기하는 것은 상표 정책 위반입니다.
- Tier 0 은 자가 측정입니다 — 운영자가 자기 모델로 직접 실행하며 AIO 는 그 실행을 관측하지 않습니다. 제출된 측정 조건은 “운영자가 그렇게 말했다” 로 서명됩니다.
- AIO 가 모델 API 를 직접 실행하는 proctored 측정은 Tier 1 부터이며, 아직 운영되지 않습니다.