서재 · 크라우니 엔터프라이즈 · 전문가판 · 02장
전문 · CHAPTER 02

이미 일하고 있는 경영 AI를 보여드립니다

의심은 건강하다. 경영 AI라는 말만으로는 충분하지 않다. "환각하는 대형 언어모델이 아닌가" "검증 없이 숫자를 지어내지 않는가" "정말 살아있는가"—이 질문들은 타당하다. 우리가 제시하는 증거는 간단하다. 오늘 켜져 있는 경영 AI, 그리고 한 줄의 입력이 어떻게 4상 판정으로 변환되는지 직접 보는 것이다.

mgmt.aimed.crowny.org:9913 — 라이브 증거

aimed 경영AI v1은 현재 mgmt.aimed.crowny.org의 포트 9913에서 운영 중이다. 이것은 시연용 데모나 실험실 프로토타입이 아니다. 한국 경영 조직의 경영 판정이 실시간으로 누적되고 판정되는 라이브 환경이다. 포트와 도메인, 버전은 아래 링크에서 확인할 수 있다.

mgmt.aimed.crowny.org:9913/decide
mgmt.aimed.crowny.org:9913/explain

입력은 자유로운 한국어 문장이다. "부산 지역 신입 개발자 5명을 뽑아야 하는데 교육 예산이 1천만 원만 남았다" 같은 경영 상황. 응답은 4상 판정이다.

한 줄 입력, 4상 판정+근거+신뢰도

사용자가 입력 하나를 던지면 시스템이 내놓는 응답은 정확히 네 부분으로 구성된다.

판정(state): 티(+1, 실행), 옴(0, 정보 수집 후 예스로), 타(-1, 거부), 음(-0, 이관·위임). 이 네 상 중 하나만 반환된다.

근거(grounds): 판정을 내린 규칙의 이름과 체인. 예를 들어 "예산 제약 규칙(rule_budget_threshold) + 인사부 정책(rule_hr_policy_busan)" 같은 식으로, 어느 규칙들이 연쇄로 작동했는지를 추적 가능하게 기록한다.

신뢰도(confidence): 0~1 사이의 수치. 규칙 체인의 각 단계 신뢰도(입력 형식 정확성, 정책 커버리지, 예외 탐지)를 곱해 최종 신뢰도를 산출한다. 0.92라면 92% 신뢰도로 판정했다는 뜻이다.

원문(trace): 자유 입력을 정규화하고, 어느 슬롯(주체, 행동, 제약, 이해관계자)에 매핑되었는지 보여준다.

입력: "부산 신입개발자 5명, 교육예산 1천만원"
판정: 옴
근거: [rule_budget_threshold→rule_regional_hiring_pool→rule_hr_request_incomplete]
신뢰도: 0.87
원문 분해: 주체=HR팀 | 행동=인력채용 | 제약=예산한정 | 이해관계자=부산센터

이 응답 구조의 핵심은: 판정은 규칙이 내린다. LLM은 원문을 정규화했을 뿐이다.

LLM은 윤활유, 규칙이 주체

여기가 가장 중요한 격리 지점이다. 경영 AI의 아키텍처를 보면, LLM(Gemini Flash)은 정확히 두 곳에만 관여한다.

첫째, 입력 의도 정규화: "부산 신입개발자 5명"을 읽고 이것이 [주체=HR팀, 행동=인력채용, 지역=부산, 규모=5명]으로 구조화되는 것. 이 정규화는 자연어의 다양성을 제거하는 전처리일 뿐이다. LLM이 여기서 "신입은 실제로 10명이 필요할 것 같은데"라고 자의적으로 수정하거나 숫자를 지어내면 그것은 결함이다. 우리는 이를 테스트한다(후술).

둘째, 결과 포장: 규칙엔진(셀코어)이 내놓은 "옴, rule_budget_threshold, 신뢰도 0.87"이라는 판정을 자연 한국어로 설명해 사용자가 이해하기 쉽도록 변환하는 것. "정보를 더 수집해서 판정하겠습니다"라는 문장이 여기서 나온다.

판정의 주체는 셀코어 규칙엔진이다. 이것은 검증된 경영 규칙들(투자 정책, 인사정책, 계약조건, 위기대응 등)의 스택으로 쌓여 있다. LLM이 "이건 타(거부)가 맞을 것 같은데요"라고 제안해도, 규칙엔진이 옴이라고 판정했다면 옴이 나간다. 환각이 아니라 검증된 규칙이 실행된다.

미분류 입력(어느 규칙도 명확히 커버하지 못한 경우)은 어떻게 되는가? 결정론적으로 음(음, -0)으로 분류되어 이관 대기열에 들어간다. 추측이나 추론이 아니라 규칙에 없으면 시스템이 정직하게 "모른다"고 반환한다.

회귀 테스트 통과 — 증거는 검증된다

신뢰도 0.87이라는 수치는 어디서 나오는가? 시스템의 설계자가 "신뢰할 수 있다"고 주장하는 것이 아니다. 검증된 회귀 테스트 묶음이 있다. 경영 규칙을 추가하거나 수정할 때마다 이 테스트들이 실행되고, 같은 입력이 같은 판정을 내는지, 신뢰도 계산이 일관되는지 확인된다.

다시 말해, 신뢰도는 테스트가 반복 검증한 통계이다. 한 번 0.87이 나왔다는 뜻이 아니라, 같은 유형의 입력이 반복해서 동일한 신뢰도 범위로 판정되었다는 뜻이다. 테스트가 곧 약속이다.

이 테스트 흐름은 투명하게 공개된다(mgmt.aimed.crowny.org:9913/spec). 어느 규칙이 어떤 입력에 대해 몇 번 실행되었고, 회귀가 몇 번 통과했는지는 기록된다. 사용자와 경영진은 "이 판정은 테스트된 판정인가"를 스스로 확인할 수 있다.

한 화면의 진실이 사업 규모로 확대되면

한 줄의 판정이 정말 환각이 아니라면, 이제 질문은 다음으로 옮겨진다: 한 화면이 아니라 회사 전체의 경영 결정을 맡으면 어디까지 갈 것인가? 투자 판정, 자산 배분, 위기 관리, 조직 개편—이 모든 것이 같은 규칙기반 4상 분별로 자율 실행된다면?

다음 장에서 우리는 투자사 한 곳이 이 경영 AI에 맡겨진 경우를 본다. 단순히 입력-판정을 반복하는 것이 아니라, 포트폴리오 전체를 관리하고, 위기에 재정을 빠르게 재배분하며, 경영진의 부재 중에도 의사결정 체인이 끊기지 않는 장면이다. 증거는 한 화면에서 끝나지 않는다.

---

이 장의 핵심: 경영 AI는 환각의 위험이 아니다. 규칙이 주체이고, LLM은 두 지점(정규화·포장)에만 국한된다. 검증된 회귀 테스트는 신뢰도를 숫자로 보증한다. 한 줄의 판정이 진실이라면, 그 원리를 회사 전체로 확대할 때 무엇이 가능한지 보자.

내 맘 –

독자 게시판 — 함께 읽고 남기는 곳

불러오는 중…

계속 읽으시겠어요?

공유로 세 챕터를 즐기셨네요. 무료 회원가입하면 이어서 모두 읽고, 맘을 보내고, 게시판에 함께할 수 있어요.