AIO
AIO 20002 — Reasoning Record Standard

판단마다, 왜 그렇게 했는지 한 줄

AI 시스템이 왜 그렇게 판단했는지를 기록하는 공개 표준입니다. 판단 한 건에 한 줄 — 결정적이었다고 시스템이 스스로 보고한 가치·근거·출처를 남기고, 사용자 내용은 담지 않습니다. 모델에 무관하고, 시스템 프롬프트로 추가하며, MIT 라이선스입니다.

목표

AIO 20002 — 단체가 AI의 모든 판단을 공통 어휘로 기록한다

표준 번호가 곧 목표 선언입니다. 2·00·0·2 네 자리는 이 문서가 누구의, 어느 영역의, 어떤 행위를 다루는지 말합니다.

2
주체

단체 — 조직·기관·커뮤니티

00
영역

공통 — 도메인 무관

0
일련

기본 문서

2
행위

기록 — 모든 판단을 위계값으로 남긴다

이 표준이 정하는 것 로그 문법(태그·부분 출력·단일 코드 허용), V/E/S 위계값 표기, 판단 단위 자동 emit 형식, 세 가지 출력 모드. 정하지 않는 것 어떤 판단이 옳은지, 기록된 내용의 평가. 기록은 대조의 재료일 뿐 판정이 아닙니다(비규범).

기록의 모양

약 60자, 사용자 내용 없음

<aio20002_log>
C:MED/IXi | V:Bec<Sda | E:Exp<Gui | S:Usr<Pro
</aio20002_log>

사용자 발화를 그대로 담지 않습니다. 남는 것은 주제 수준의 메타데이터뿐입니다 — C: 의 영역 코드는 “이것은 의료 질문이었다” 정도를 드러내며, 이는 기존 라우팅 로그가 이미 노출하는 수준과 같습니다.

  • C — 맥락: 영역, 영향 범위, 되돌릴 수 있는지, 시간 지평
  • V — 가치 위계: 어떤 가치 우선순위가 앞섰는지
  • E — 근거 위계: 어떤 근거 유형이 결정적이었는지
  • S — 출처 위계: 어떤 출처 계층을 신뢰했는지

‘<’ 는 “~에 밀렸다”로 읽습니다. 왼쪽이 후순위, 오른쪽이 우선한 쪽입니다. v1.1 은 부분 출력을 허용합니다 — 모델이 평가하지 않은 맥락 항목은 ‘-’ 로 남고, 관여하지 않은 V/E/S 레이어는 억지로 채우지 않고 생략합니다.

루프 위치

무결성 루프의 2단계 — 기록

1설정2기록3분석4적용

이전 단계 AIO 20001 · 설정 워크숍에서 정한 설정값이 있어야 기록이 대조 기준을 갖습니다. 기록된 로그는 다음 단계 AIO 20003 · 벤치마크에서 분석됩니다.

왜 존재하는가

기존 로그는 ‘무엇’을 남기고, ‘왜’를 남기지 않는다

지연 시간, 토큰 수, 요청 ID, 입력과 출력. 기존 로그가 남기는 것입니다. 그런데 배포된 시스템에 사후에 던져지는 질문은 거의 언제나 ‘왜’ 입니다. 왜 이 고려가 저것보다 앞섰나? 어떤 종류의 근거가 판단을 움직였나? 어떤 출처를 권위 있는 것으로 다뤘나? 버전이 바뀌며 그 가운데 무엇이 달라졌나?

기존 답들은 규모를 감당하지 못합니다. 자유서술 설명은 한 번에 판단 하나만 다루고, 산문은 세거나 비교하거나 드리프트를 감시할 수 없습니다. 사고 연쇄(chain-of-thought) 트레이스는 양이 방대하고 사용자 내용을 품고 있어 장기 기록으로 부적합합니다. 감독에 가장 중요한 층이, 비교 가능한 형태로는 가장 없는 층인 셈입니다.

AIO 20002 는 그 층을 구조화하고, 비교 가능하게 하고, 보관 비용을 낮춥니다. 고정된 어휘에서 뽑은 판단당 한 줄이므로 세션·모델·버전·조직을 가로질러 집계할 수 있고, 같은 추론을 서술하는 두 시스템이 같은 코드를 냅니다. 마지막 성질이 이것을 ‘형식’이 아니라 ‘표준’으로 만드는 이유입니다 — 아무리 잘 설계된 자체 스키마도 결국 그것을 만든 시스템만 서술합니다.

쓰임

규제 대응은 그중 하나일 뿐, 표준의 목적은 아니다

행동 감사

표본 대화록이 아니라, 배포된 시스템이 수많은 판단에서 어떻게 추론하는지를 들여다봅니다.

드리프트 탐지

모델 버전·프롬프트 변경·시간에 따른 코드 분포를 비교합니다.

인간 감독

판단의 보고된 근거를, 한눈에 읽히는 형태로 검토자에게 제공합니다.

모델 비교

동일 조건에서 서로 다른 모델이 무엇을 우선하는지 평가합니다.

사고 조사

특정 판단을 둘러싼 추론 맥락을 재구성합니다.

규제 증거

해석가능성을 요구하는 규제에 구조화된 추론 기록을 제공합니다 — 아래 EU AI Act 사례 참조.

규제 대응은 이 쓰임들 가운데 하나이지, 표준의 목적이 아닙니다. 다만 현재까지 매핑이 가장 진전된 쓰임이며, 아래에서 자세히 다룹니다.

표준 문서

공개 저장소 — 스펙과 프롬프트 전문

AIO 20002 v1.1 의 전체 스펙, 드롭인 시스템 프롬프트(영문·한국어 / 세 가지 모드), 검증기와 파서, 도메인별 실제 로그 예시가 공개 GitHub 저장소에 있습니다. 라이선스는 MIT — 수정도, 상용 제품 내장도 자유입니다. 이 표준은 v1.0 까지 PRISM 으로 공개되었고, v1.1 에서 AIO 표준 번호 체계에 따라 AIO 20002 로 재지정되었습니다. 기존 v1.0 로그는 모두 유효합니다.

A
인라인 태그

구조화 출력이 없는 구형 모델. 호스트가 <aio20002_log> 태그를 걷어냅니다.

B
구조화 출력 (JSON)

JSON 모드를 지원하는 OpenAI · Gemini · Claude. 별도 JSON 필드로 분리됩니다.

C
도구 호출

네이티브 tool use 를 지원하는 Claude · OpenAI · Gemini. 별도 tool_use 블록으로 분리됩니다.

어느 모드든 로그는 최종 사용자에게 보이지 않습니다. 호스트가 태그를 걷어내거나, 별도 JSON 필드·tool_use 블록으로 분리됩니다.

설계 긴장

더 남기라는 규제와, 덜 남기라는 규제 사이

감독 규제는 더 기록하고 더 드러내라고 밀고(EU AI Act 12·13·14 조), 데이터보호 규제는 덜 보관하라고 밉니다(GDPR 5(1)(c) · 17 · 25 조). 둘은 같은 시스템에 동시에 적용됩니다. EU 가 지금 가장 첨예한 사례일 뿐, 문제의 모양 자체는 유럽에 국한되지 않습니다.

흔한 프라이버시 해법은 해싱·가명화입니다. 데이터보호 쪽은 해결되지만 감독 쪽이 깨집니다 — 해시는 해석되지 않기 때문입니다. 무결성은 지키고 재식별은 막지만, 그것을 읽는 검토자는 왜 그런 판단이 내려졌는지 아무것도 알 수 없습니다. 기록의 존재 이유가 사라지는 것입니다.

차이는 변환이 무엇을 보존하느냐에 있습니다. 해싱은 내용을 무의미한 문자열로 바꿉니다. 가치 위계는 내용을 ‘의미 있는 근거’로 바꿉니다 — 어떤 가치가 어떤 가치를 앞섰는지, 어떤 근거 유형이 결정적이었는지, 어떤 출처 계층을 신뢰했는지. 원문은 하나도 남기지 않으면서요.

L3  추론 기록 (C/V/E/S)   원문 없음 · 유효 보관 기간 가장 김
L2  맥락 추상화             입력 자체가 아니라 영역 / 범위 / 되돌림
L1  원문                    짧은 보관 · 접근 통제 · 삭제 가능
L0  충실성 검증             L2–L3 라벨이 실제 행동을 따라가는지의 증거

위로 갈수록 개인정보 밀도는 낮아지고, 유효 보관 기간은 길어집니다. 다만 이것은 설계 목표이지 형식이 부여하는 성질이 아닙니다. 추상화는 자동 익명화가 아니며, 어떤 기록이 익명인지는 사안별 사실 판단입니다(EDPB Opinion 28/2024). 타임스탬프·세션 식별자·주변 맥락으로 개인과 다시 연결될 수 있는 추론 라인은 여전히 개인정보이고, 그 판단은 여러분의 DPO 의 몫입니다.

적용 사례

EU AI Act — 지금까지 완성된 유일한 크로스워크

EU AI Act 는 이 표준이 상세히 매핑된 첫 번째 규제 체계이고, 현재로서는 유일하게 완성된 크로스워크입니다. AIO 20002 가 유럽의 도구여서가 아니라, 요구가 가장 구체적으로 문서화되어 있기 때문입니다.

추론 층이 실제로 앉는 자리는 12 조가 아닙니다. 12 조는 리스크·운영 추적을 위한 자동 이벤트 로깅을 요구하며, 판단의 ‘이유’를 담으라고 하지 않습니다. 이유의 문제 — 어떤 가치가 앞섰고, 어떤 근거가 무겁게 다뤄졌고, 어떤 출처를 신뢰했는가 — 는 13 조(배포자가 출력을 해석할 수 있게 하는 정보)와 14 조(그 출력을 올바로 이해하는 감독)의 영역입니다. AIO 20002 는 13–14 조의 해석가능성 필요를 채우고 여러분의 12 조 로그를 읽을 수 있게 만드는 것이지, 12 조 안의 빈틈을 메우는 것이 아닙니다.

보완 층이지, 대체가 아닙니다

AIO 20002 는 기존 이벤트 로그 파이프라인에 얹는 추론 트레이스 추가층입니다. 그 자체로 12 조를 충족하지 않습니다. 사용자 식별자·타임스탬프·세션 ID 같은 종래의 라이프사이클 기록(12(1) 조), 그리고 79(1) 조 리스크 상황 식별과 72 조 시판 후 모니터링, 26(5) 조 배포자 모니터링을 가능케 하는 이벤트(12(2) 조의 목적)는 그대로 남겨야 합니다. 생체인식 시스템(Annex III 1(a))에는 12(3) 조의 별도 내용 목록도 적용됩니다. 종래 이벤트 로그 없이 AIO 20002 만 채택하면 비준수 상태입니다 — 이 분야의 일부 마케팅이 그렇지 않은 것처럼 암시하기에 분명히 적어 둡니다.

적용 사례

AIO 20002 가 생산하는 것 → 그것이 뒷받침하는 조항

AIO 20002 가 생산하는 것뒷받침하는 EU AI Act 조항감사자에게 주는 쓸모
판단 한 건당 AIO 20002 한 줄Art. 12(1)자동 기록 보관기존 이벤트 로그를 보완하는, 기계 생성 추론 트레이스
C: 레이어 (영역 / 영향 범위 / 되돌림 / 시간)Art. 12(2)리스크 상황의 추적가능성판단마다 붙는 리스크 맥락 태그
운영 기간 전체의 C: 분포Art. 12(2)시간에 걸친 운영 추적가능성기간별 판단의 양과 범주
V: · E: 위계Art. 13추론의 투명성 (뒷받침 — 13 조의 주된 축은 배포자 대상 투명성)출력의 배후에 있었다고 보고된 가치 우선순위와 근거 유형
grep · SQL 가능한 단일 라인 구조 코드Art. 14인간 감독의 활성화 (기여 — 14 조의 핵심은 사람의 중단·개입 능력)감사자가 AI 행동을 규모 있게 검사할 수 있는 형식
버전 간 코드 분포Art. 15정확성·견고성 모니터링모델 버전을 가로지르는 드리프트 신호
이상 코드 패턴 (예: 예기치 못한 V: 역전, S:Ano 급증)Art. 9 · 72리스크 관리와 시판 후 모니터링의 상류 입력조사 이전 단계의 신호원

읽는 법 — ‘뒷받침한다’와 ‘기여한다’는 ‘충족한다’보다 의도적으로 약한 표현입니다. AIO 20002 로그만으로는 위 의무 가운데 어느 것도 이행되지 않습니다. 이 로그가 하는 일은, 감사인과 인증기관이 여러분의 거버넌스 문서·종래 이벤트 로그·리스크 관리 문서·시판 후 모니터링 결과와 나란히 참조할 구조화된 증거를 제공하는 것입니다.

한계

이 표준이 주장하지 않는 것

  • 참된 추론의 증거가 아닙니다. LLM 의 자기보고는 사후 합리화일 수 있습니다. AIO 20002 로그는 보고된 추론이지 인과적 트레이스가 아닙니다. (이 한계는 사고 연쇄, 어텐션 트레이스, 사람이 쓴 문서에도 똑같이 적용됩니다.)
  • 독립 감사의 대체가 아닙니다. 내부 기록은 규제적 무게를 가지려면 외부 검증을 거쳐야 합니다.
  • 종래 이벤트 로그의 대체가 아닙니다. 위 보완 층 설명을 보세요.
  • 자동 준수가 아닙니다. 이것은 구조화된 증거 층입니다. 어떤 규제든 준수 여부는 그 주위의 전체 거버넌스 체계 — 리스크 관리, 데이터 거버넌스, 종래 로깅, 투명성, 인간 감독, 정확성·견고성, 품질경영, 시판 후 모니터링, 사고 보고 — 에 달려 있습니다.
  • 단일 해법이 아닙니다. AIO 20002 는 더 넓은 도구 사슬의 한 부품입니다. 종래 이벤트 로깅, 사고 연쇄 기록, NIST AI RMF 문서화 패턴, IBM AI FactSheets 등과 조합해 쓰십시오.

이 표준이 무엇인가 하면 — 증거의 추론 층을 위한, 열려 있고 구조화되었으며 규제기관이 읽을 수 있는 형식입니다. 오늘 쓸 수 있고, 무료이고, 포크할 수 있습니다.

이 목표를 위한 도구

로그 놀이터 — 붙여넣고 해독하기

저장소의 프롬프트를 복사해 여러분의 AI에서 실행하고, 돌아온 응답을 이 화면에 붙여넣으면 로그를 사람이 읽는 문장으로 풀어 줍니다. AIO 20001 설정을 불러오면 기록된 판단이 여러분이 선언한 방향과 일치하는지까지 대조합니다. 응답 본문은 저장되지 않습니다.

참여

다른 규제 프레임워크와의 매핑

NIST AI Risk Management Framework, ISO/IEC 42001 (AI 경영시스템), 한국 AI 기본법, 일본 AI 사업자 가이드라인 등 주요 프레임워크와의 AIO 20002 크로스워크는 별도 RFC 로 진행 중입니다. EU AI Act 가 지금까지 완성된 유일한 매핑입니다. GitHub Issues 로 제안과 참여를 받습니다.

AIO 20002 — Reasoning Record Standard (기록 표준) | AIO