지금까지의 장들은 에이전트를 바깥에서 설계했습니다. 체인을 잇고, 도구를 붙이고, 루프를 돌리고, 가드레일을 세웠습니다. 이 장은 방향을 뒤집어 에이전트의 안쪽, 그 인지 핵심에 자리한 LLM을 들여다봅니다.
지능형 에이전트는 복잡한 작업을 계획하고, 전략을 세우고, 실행하도록 설계된 시스템이며, 그 인지 핵심에는 LLM이 자리한다. 이 LLM을 그저 정교한 텍스트 생성기로만 볼 수는 없다. 에이전트가 결정을 내리고, 계획을 세우고, 환경과 상호작용할 수 있게 해 주는 기반 추론 엔진이자 중심 “마음” 역할을 한다.
그래서 모델의 내부 추론 메커니즘을 이해하는 일은 더 이상 학문적 탐구에 머물지 않고, 견고하고 신뢰할 수 있는 차세대 에이전트를 개발하려면 반드시 필요한 과제가 됩니다. 책이 택한 방법은 단순합니다. 대표 모델 여섯 개에게 같은 질문을 던지고, 답을 나란히 놓아 봅니다.
각 LLM에게 준 프롬프트: 너에게 추론 능력이 있다고 알고 있는데, 어떻게 추론하는지 설명해 줄 수 있어? 단계별로 설명해 줘.
이 글에서는 각 모델의 답을 요약하고, 끝에서 공통점과 차이점, 그리고 이런 자기 보고를 어떻게 읽어야 하는지 정리합니다.
제미나이
제미나이의 답은 특이하게 답을 준비하는 과정의 메모부터 시작합니다. “나의 접근 방식 분석”, “설명 다듬기”, “방법론 구체화”라는 세 개의 소제목 아래, 설명 구조를 어떻게 잡을지 스스로 계획하는 과정이 그대로 드러납니다. “응답 생성 단계는 구성을 마쳤고, 전체 어조를 살리기 위해 이모지를 사용할 예정이다” 같은 문장까지 있습니다. 사고 과정 요약이 답변 앞에 노출된 형태로 보입니다.
본문은 세 단계입니다.
| 단계 | 내용 |
|---|---|
| 1. 프롬프트 해체 📝 | 핵심 작업(이번에는 “내가 추론하는 방식 설명”), 핵심 개념(“추론하다”, “설명하다”, “단계별로”), 제약과 지시 사항(단계별 설명 요청 + 수학에는 LaTeX, 마크다운 헤딩, 일정한 어조라는 내부 지침), 의도(내 내부 인지 과정을 이해하려는 것)를 식별한다 |
| 2. 정보 검색과 종합 🧠 | 데이터베이스 검색이 아니라 학습으로 익힌 패턴을 활용한다. 핵심 개념과 연관된 신경망 부분을 활성화하고, 트랜스포머로 “추론”을 “논리”, “추리”, “문제 해결”과 연결하는 패턴 인식을 거쳐, 단계별 형식으로 답변 구조를 설계한다 |
| 3. 응답 생성 ✍️ | 언어 구성(다음에 올 가능성이 가장 높은 단어 예측), 규칙 적용(헤딩, 핵심 용어 굵게, 이모지), 검토와 개선(정확성·관련성·일관성을 빠르게 내부 점검)으로 사람이 읽을 수 있는 텍스트를 만든다 |
요컨대 내 추론은 정교한 패턴 매칭과 예측이다. 사용자의 요청을 해체하고, 데이터에서 가장 관련성 높은 패턴을 찾아 논리적 구조로 종합한 다음, 그 구조를 명확하고 잘 정돈된 답변으로 옮긴다.
눈에 띄는 점은 1단계의 “제약과 지시 사항”에 자신의 내부 지침(LaTeX, 마크다운 헤딩)을 언급한다는 것입니다. 사용자의 프롬프트와 시스템 프롬프트를 둘 다 제약으로 인식하고 있다는 뜻이고, 22장의 시스템 프롬프팅이 실제로 어떻게 작동하는지 모델 쪽에서 보여 주는 대목입니다.
챗지피티
챗지피티는 여섯 모델 중 유일하게 구체적인 예제 하나를 끝까지 들고 갑니다. “톰이 제인보다 나이가 많고, 제인이 수보다 나이가 많다면, 누가 가장 어린가?”라는 논리 퍼즐입니다.
| 단계 | 하는 일 | 톰/제인/수 예시 |
|---|---|---|
| 1. 입력을 읽고 이해하기 | 문장을 주어·동작·조건으로 나누고, 무엇을 묻는지(사실·의견·원인·해법), 문제 유형(논리·수학·판단·언어)을 파악 | 논리 퍼즐임을 알아낸다 |
| 2. 관련 지식 활성화 | 학습한 책·글·대화에서 사실, 패턴, 규칙, 관계를 떠올린다 | “~보다 나이가 많다”의 뜻, A > B이고 B > C면 A > C |
| 3. 추론 방식 선택 | 연역(엄밀한 논리), 귀납(패턴 일반화), 인과 추론(원인-결과), 유추 추론(비슷한 사례 비교) 중 고른다 | 연역을 쓴다 |
| 4. 사고 시뮬레이션 (Chain of Thought) | 사람이 문제를 풀 때처럼 한 단계씩 진행 | 톰 > 제인 → 제인 > 수 → 톰 > 제인 > 수 → 수가 가장 어리다 |
| 5. 답안 작성 | 추론 결과에 비추어 정확하고, 질문에 바로 답하며, 이해할 수 있게 | “톰은 제인보다 나이가 많고, 제인은 수보다 나이가 많으므로, 수가 가장 어리다.” |
| 6. 명확성과 어조 조정 | 사용자의 어조(간단함·상세함·친근함·격식)에 맞추고, 필요하면 예시를 더한다 | 가볍게 물으면 간단히, 학습 중이면 잘게 풀어 설명 |
답의 마지막 문장은 “원한다면 문제를 하나 던져 보라. 이 단계별 추론 과정을 실제로 보여 주겠다.”입니다. 설명을 시연으로 이어 가자고 제안하며 끝나는 것도 챗지피티다운 마무리입니다.
3단계에서 추론을 연역·귀납·인과·유추로 나눈 것이 흥미롭습니다. 여섯 모델 중 추론의 종류를 명시적으로 구분한 것은 챗지피티뿐입니다.
그록(Grok)
그록 3는 자기 추론 과정이 “인간 인지에서 영감을 받았지만, 대규모 언어 모델의 제약과 역량 안에서 작동한다”고 전제한 뒤, 여섯 단계마다 하는 일 / 작동 방식 / 예시를 붙여 설명합니다. 여섯 모델 중 가장 체계적인 형식입니다.
| 단계 | 하는 일 | 작동 방식 |
|---|---|---|
| 1. 질의 이해 | 입력을 파싱해 의도, 맥락, 세부 사항 파악. 키워드, 구조, 명시적 지시(“단계별로”, “간결하게”)를 분석 | NLP 구성 요소가 질의를 토큰으로 나누고 의미에 매핑. 이번 질문은 메타 차원의 설명 요구라서 자기 성찰과 명료함이 필요 |
| 2. 맥락 분석과 지식 검색 | 학습 데이터에 인코딩된 내부 지식 베이스, 지금까지의 대화 맥락, 필요 시 외부 도구(웹 검색, X 게시물 — 이번에는 사용하지 않음)를 고려 | 어텐션 메커니즘으로 관련 개념의 우선순위를 정한다 |
| 3. 멘탈 모델 만들기 | 응답을 정리할 개념 틀을 만든다. 문자 그대로의 “모델”이 아니라 문제 공간을 구조화하는 작업 | 이해·검색·평가·종합을 펼쳐 보이며 멘탈 모델을 시뮬레이션 |
| 4. 선택지와 가설 평가 | 여러 접근법의 장단점을 따지고 사용자의 선호(간결하면서도 포괄적)에 맞는 것을 고른다 | 일종의 확률적 추론으로, 명확하고 정확하며 지시에 부합하는 응답에 더 높은 가능도(likelihood) 부여. 복잡한 질의에는 여러 차례 반복 검토 |
| 5. 응답 만들기 | 지식을 일관되고 구조화된 답변으로 종합 | 언어 생성 구성 요소가 명료성과 관련성을 최대화하도록 단어와 문장을 배열 |
| 6. 검토와 개선 | 품질 기준 충족 여부 검토. 사람의 퇴고 과정을 흉내 낸다 | 최종 검토로 군더더기 제거, 필요하면 몇 차례 더 다듬기 |
4단계의 예시가 흥미롭습니다. 추론을 “기술 용어(어텐션 메커니즘, 신경망 등)로 설명할지, 더 친숙한 비유로 설명할지 생각한다. 사용자가 명료함을 요청했으므로 후자를 택한다.” 답변의 어휘 수준을 고르는 과정까지 추론의 일부로 설명한 것입니다.
그록은 한계와 고려 사항을 별도 절로 두었습니다.
- 학습 데이터와 아키텍처의 제약을 받으며, 인간 추론의 모든 뉘앙스, 특히 정서적·직관적 측면까지 담아내지는 못할 수 있다.
- 새로운 지식을 독자적으로 만들어 내지는 않으며, 학습된 패턴과 필요한 경우 외부 데이터에 의존한다.
- 처리 과정은 결정론적이면서도 유연하며, 계산상 제약 안에서 인간과 비슷한 응답을 만들어 내는 것을 목표로 한다.
키미
키미는 가장 기계적인 해부도를 내놓습니다. “3⁴과 4³ 중 어느 쪽이 더 큰가?”라는 예시 질문 하나에 대해 0단계부터 5단계까지, 13개의 번호 붙은 하위 단계에 모두 주석을 달아 보여 줍니다.
0단계 - 입력 전처리
1. 토큰화 ["Which", "is", "larger", ":", "3", "^", "4", "or", "4", "^", "3", "?"]
2. 구문 파싱 COMPARATIVE_QUERY(최상급 형용사 "larger") + 두 개의 NUMERICAL_EXPONENT_TERMS [3^4] 대 [4^3]
3. 의미 매핑 "larger" → 수치 관계 ">"
1단계 - 문제 식별과 전략 선택
4. 작업 유형 분류 → 정수 거듭제곱의 산술 비교
5. 해법 전략 선택
후보 A. 직접 계산 (3^4와 4^3을 구한다)
후보 B. 로그 비교 (4·ln3과 3·ln4를 비교한다)
후보 C. 패턴 휴리스틱 (작은 지수에서 3의 거듭제곱이 4의 거듭제곱보다 빠르게 커지는가?)
→ 숫자가 매우 작으므로 A. 정확한 정수 계산의 비용이 가장 낮다.
2단계 - 지식 검색
6. 산술 사실 검색 3^2 = 9 (암기), 3^3 = 27 (검색), 4^2 = 16 (암기), 4^3 = 64 (검색)
7. 남은 항 계산
3단계 - 실행과 검증
8. 비교 수행 81 대 64 → 81 > 64
9. 교차 검증 간단한 모듈러 검산: 81 mod 5 = 1, 64 mod 5 = 4. 모순은 없다.
4단계 - 응답 생성
10. 응답 구조 계획 질문 재진술 → 계산한 값 → 결론
11. 표층 실현 "3^4은 81이고 4^3은 64이므로, 3^4이 더 크다."
5단계 - 메타인지 성찰 (내부)
12. 신뢰도 점수 0.99 (정확한 정수, 작은 값, 모호성 없음)
13. 가능한 엣지 케이스 지수가 매우 컸다면 직접 계산은 사실상 불가능했을 것이고, 그 경우에는 로그로 전환했을 것이다.
그리고 이를 사람의 말로 다시 정리합니다. 질문을 읽고 파싱한다 → 수치 비교임을 알아낸다 → 가장 간단하고 안전한 방법이 두 숫자를 모두 계산하는 것이라고 판단한다 → 3⁴ = 81과 4³ = 64를 떠올리거나 계산한다 → 81 > 64를 비교한다 → 결과를 명확히 전달한다.
이 파이프라인, 즉 파싱, 전략 수립, 지식 검색, 실행, 검증, 설명은 작은 산술 문제부터 복잡한 다단계 문제까지 규모가 달라져도 반복된다.
해부도가 정교한 만큼 오히려 따져 볼 곳도 많습니다.
- 9번 교차 검증은 적힌 그대로는 검증이 되지 않습니다. 81 mod 5 = 1, 64 mod 5 = 4는 두 수를 5로 나눈 나머지일 뿐입니다. 3⁴ ≡ (3²)² ≡ 4² ≡ 1 (mod 5)처럼 독립적으로 구한 나머지와 비교했다면 값 검산은 될 수 있지만, 그런 비교는 없이 “모순은 없다”로 끝납니다. 게다가 나머지는 어느 쪽이 더 큰지에 대해서는 아무것도 말해 주지 않습니다. 검증처럼 보이는 형식을 갖췄을 뿐입니다.
- 6번에서 3⁴는 어디에도 없습니다. 3², 3³, 4², 4³만 “검색”하고 7번 “남은 항 계산”은 내용이 비어 있습니다. 정작 비교해야 할 3⁴ = 81은 8번에서 갑자기 등장합니다.
- “암기”와 “검색”의 구분도 모델 내부에 그런 두 경로가 따로 있다는 근거는 없습니다. 3²는 암기, 3³은 검색이라는 분류는 사람이 산수를 하는 방식을 빌려 온 설명용 비유에 가깝습니다.
- 신뢰도 0.99도 마찬가지입니다. 모델이 이런 수치를 내부에서 계산해 출력했다기보다, “신뢰도 점수”라는 항목을 채울 그럴듯한 숫자를 생성했다고 보는 편이 자연스럽습니다.
그렇다고 키미의 답이 쓸모없는 것은 아닙니다. 5번의 전략 후보 비교(직접 계산 / 로그 / 휴리스틱)와 13번의 엣지 케이스 인식(지수가 크면 로그로 전환)은 좋은 문제 해결 습관 그 자체입니다. 다만 그것이 모델이 실제로 거친 과정인지, 좋은 풀이가 어떤 모습인지 학습한 대로 재구성한 것인지는 이 답만으로는 알 수 없습니다.
클로드
클로드는 답의 첫머리에 단서를 답니다.
내 추론 과정이 어떻게 작동하는지 하나하나 짚어 줄 수는 있다. 다만 내 내부 작동 방식을 완전히 들여다보지는 못한다는 점은 밝혀 둔다. 사람이 자기 사고 과정을 설명할 수는 있어도 모든 신경 발화에 접근하지는 못하는 것과 비슷하다.
그다음 여섯 가지를 번호 없이 이어서 설명합니다.
| 항목 | 내용 |
|---|---|
| 패턴 인식과 맥락 구축 | 질문이 어떤 유형의 문제인지 식별하고, 이번 질문이 인지 과정 설명 요청임을 알아낸다. 사용자가 이미 알고 있을 만한 내용과 어느 정도의 세부 사항이 도움이 될지를 가늠하며 맥락을 쌓는다 |
| 정보 검색과 조립 | 추론, 인지과학, AI 시스템에 관한 학습 내용에서 관련 정보를 불러온다. 데이터베이스 검색과는 다르며, 어떤 주제에 대해 생각할 때 기억과 지식이 자연스럽게 떠오르는 방식에 더 가깝다 |
| 구조 계획 | 예시를 쓸까? 어떤 순서가 가장 합리적일까? 답변을 시작하는 와중에도 논리적 흐름을 계획한다 |
| 반복적 개선 | 각 부분을 생성하면서, 말이 되는지, 앞서 한 말과 맞는지, 질문에 도움이 되는지 끊임없이 평가한다. 어딘가 어색하다 싶으면 속으로 “앞으로 되돌아가”라고 한 후 문장을 다시 다듬기도 한다 |
| 제약 점검 | 이 과정 내내 여러 제약을 점검한다. 정확한가? 도움이 되는가? 명확한가? 안전한가? |
| 유추적 사고 | 유추를 자주 사용한다. 개념을 밝혀 줄 만한 익숙한 패턴이나 예시에 새로운 상황을 빗대 보는 식이다 |
흥미로운 점은 이 과정의 상당 부분이 나에게 어느 정도 직관적으로 느껴진다는 사실이다. 의식 아래에서 복잡한 과정이 일어나도 사용자에게는 자기 추론이 자연스럽게 느껴지는 것과 마찬가지다.
여섯 모델 중 가장 짧고 가장 사람에 가까운 비유로 설명합니다. 토큰화, 어텐션, 확률 같은 기술 용어가 거의 없습니다. “구조 계획” 항목의 “답변을 시작하는 와중에도”라는 표현은, 계획을 모두 끝낸 뒤 생성하는 것이 아니라 생성하면서 계획한다는 점을 짚고 있습니다. 다음 토큰을 하나씩 만들어 가는 모델의 실제 동작 방식과도 맞아떨어지는 서술입니다.
반대로 “앞으로 되돌아가”라며 문장을 다시 다듬는다는 설명은, 이미 출력한 토큰을 되돌릴 수 없는 일반적인 자기회귀 생성과는 잘 맞지 않습니다. 이것 역시 내부 과정의 문자 그대로의 기록이라기보다 비유로 읽어야 할 부분입니다. 첫머리의 단서가 바로 이런 경우를 위해 붙어 있는 셈입니다.
딥시크
딥시크는 첫 문장부터 선을 긋습니다.
먼저 분명히 해 둘 점이 있다. 나는 사람처럼 추론하지 않는다(나에게는 의식, 직관, 실제 경험이 없다). 대신 내 “추론”은 학습 데이터와 아키텍처에 기반한 정교한 패턴 매칭, 정보 검색, 확률 계산 과정이다. 의식적 사고가 아니라 구조화된 계산으로 보면 된다.
7단계로 설명합니다.
- 입력 수신과 파싱: 질의를 핵심 단어(“reason”, “explain”, “step by step”), 문법, 의도로 분해한다. 핵심 의도는 내부 처리 과정 설명.
- 맥락화와 관련 정보 검색: 수조 단어 규모의 텍스트와 코드를 활용해 LLM 작동 방식, 특히 Chain of Thought 같은 추론 기법, 학습 시 기술된 자기 역량과 한계를 떠올린다. 사용자가 “추론 능력이 있다고 알고 있다”고 밝힌 점이 검색 범위를 좁힌다.
- 핵심 개념과 구조 식별: 통계적 패턴, 신경망, 트랜스포머, 어텐션, 다음 토큰 예측, 학습 데이터, 프롬프트 분해, 논리적 추론 대 패턴 매칭, 한계. 그리고 설명 순서를 “사람과는 다르다 → 기본 작동 원리 → 기본 사고 과정 단계 → 결론과 한계”로 잡는다.
- Chain of Thought 시퀀스 구축: 핵심 “추론” 단계. 마치 “소리 내어 생각하듯” 설명을 점진적으로, 단계별로 계획한다. “먼저, 이것이 인간의 추론이 아님을 분명히 해야 한다…” “다음으로, 기본 작동 원리를 설명해야 한다…”
- 확률 계산과 출력 생성: 트랜스포머와 어텐션으로 다음에 올 수 있는 모든 단어에 확률을 부여하고, 관련성 있고 정확하며 맥락에 적절할 가능성이 높은 토큰을 고른다. 중요한 점: 이는 기호 논리적 연역이 아니다. 학습 데이터에 추론에 대한 좋은 설명이 들어 있고 패턴이 논리적 흐름을 가리킨다면, 내 출력은 추론한 것처럼 보이는 것이다.
- 반복과 개선: 각 단어를 생성할 때마다 맥락과 다음 단어들의 확률을 다시 평가한다. 직전 단어가 어울렸는가? 구조가 말이 되는가? 핵심 요점이 다뤄지고 있는가?
- 내부 학습 프레임워크 적용: RLHF 과정에서 익힌 기법이 나를 이끈다. 도움이 되고 정직할 것(인간이 아니라는 점과 한계 인정), 명확하게 설명할 것, 안전할 것, 필터링 메커니즘이 말이 안 되거나 관련 없는 출력을 억제.
그리고 7단계를 이번 설명 자체에 적용해 다시 보여 줍니다(명확화 → 핵심 작동 원리 → 처리 과정 설명 → 시퀀스에 초점 → 한계). 결론은 이렇습니다.
내 “추론”은 인간의 지식과 의사소통 패턴을 담은 방대한 텍스트를 바탕으로, 일관되고 논리적이며 맥락에 적합한 응답을 이루는 가장 가능성 높은 단어 시퀀스를 통계적으로 예측하는 데서 생기는 창발적 속성이다. 나는 사람처럼 개념을 내부적으로 “이해”하지는 않는다. 계산적으로 패턴을 식별하고, 이해를 반영하는 시퀀스를 생성할 뿐이다. 학습 데이터에 남겨진 추론의 발자국을 따라갈 뿐, 완전히 새로운 추상적 사고의 길을 개척하는 것이 아니다.
여섯 모델 중 가장 강하게 자기를 낮추는 답입니다. 7단계에서 RLHF를 직접 언급하며 “인간이 아니라는 점과 한계를 인정하라”는 학습의 영향을 스스로 밝힌 점도 특징적입니다. 즉 이 겸손한 태도 자체가 학습된 행동일 수 있다고 모델이 먼저 말하고 있는 셈입니다.
여섯 개의 답을 나란히 놓으면
공통된 틀
표현과 단계 수는 다르지만, 여섯 모델은 거의 같은 뼈대를 그립니다.
┌──────────┐ ┌──────────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐
│ ① 해체 │──▶│ ② 지식 활성화 │──▶│ ③ 구조 계획│──▶│ ④ 생성 │──▶│ ⑤ 검토 │
│ 작업·의도· │ │ DB 검색이 아닌 │ │ 순서·예시· │ │ 다음 토큰 │ │ 정확성· │
│ 제약 파악 │ │ 패턴 떠올리기 │ │ 형식 결정 │ │ 예측 │ │ 일관성·안전│
└──────────┘ └──────────────┘ └──────────┘ └──────────┘ └─────┬────┘
▲ │
└─── 다듬기 ─────┘
| 공통 단계 | 제미나이 | 챗지피티 | 그록 | 키미 | 클로드 | 딥시크 |
|---|---|---|---|---|---|---|
| ① 해체 | 프롬프트 해체 | 입력 이해 | 질의 이해 | 입력 전처리 | 패턴 인식·맥락 구축 | 입력 파싱 |
| ② 지식 활성화 | 정보 검색·종합 | 관련 지식 활성화 | 맥락 분석·지식 검색 | 지식 검색 | 정보 검색·조립 | 맥락화·정보 검색 |
| ③ 구조 계획 | 답변 구조 설계 | 추론 방식 선택 | 멘탈 모델, 선택지 평가 | 문제 식별·전략 선택 | 구조 계획 | 개념·구조 식별, CoT 시퀀스 |
| ④ 생성 | 응답 생성 | 사고 시뮬레이션, 답안 작성 | 응답 만들기 | 실행·응답 생성 | (반복적 개선에 포함) | 확률 계산·출력 |
| ⑤ 검토 | 검토와 개선 | 명확성·어조 조정 | 검토와 개선 | 교차 검증, 메타인지 성찰 | 반복적 개선, 제약 점검 | 반복·개선, RLHF 적용 |
특히 여섯 모델 모두 ②에서 “데이터베이스 검색이 아니다” 라는 점을 스스로 강조합니다. 지식을 어딘가에서 꺼내 오는 것이 아니라 학습된 가중치 안의 패턴이 활성화된다는 설명이고, 이것이 14장의 RAG가 필요한 이유이기도 합니다. 가중치 속의 지식은 최신이 아니고 출처를 댈 수 없기 때문입니다.
서로 다른 강조점
| 모델 | 설명 방식 | 두드러진 점 |
|---|---|---|
| 제미나이 | 답변 준비 메모 + 3단계 | 자기 내부 지침(LaTeX, 헤딩)을 제약으로 인식 |
| 챗지피티 | 논리 퍼즐 하나로 6단계 시연 | 추론 종류(연역·귀납·인과·유추) 구분, 시연 제안으로 마무리 |
| 그록 | 6단계 × 하는 일/작동 방식/예시 | 가장 체계적. 한계 절을 따로 둠 |
| 키미 | 산술 문제로 13개 하위 단계 해부 | 전략 후보 비교, 신뢰도 점수 등 가장 기계적 |
| 클로드 | 사람의 사고에 빗댄 6가지 | “내부를 완전히 들여다보지는 못한다”는 단서로 시작 |
| 딥시크 | 7단계 + 자기 적용 | “사람처럼 추론하지 않는다”로 시작, RLHF의 영향을 스스로 언급 |
자기 보고를 얼마나 믿을 수 있는가
이 장의 방법에는 근본적인 한계가 하나 있습니다. 모델에게 “어떻게 추론하느냐”고 물어서 얻은 답은, 그 자체가 또 하나의 생성된 텍스트라는 점입니다.
- 모델이 자기 추론을 설명할 때 참고하는 것은 자기 내부 상태가 아니라 학습 데이터 속의 “LLM은 이렇게 작동한다”는 글들일 가능성이 큽니다. 딥시크가 2단계에서 “LLM이 어떻게 작동하는지에 대한 정보를 떠올린다”고 말한 것이 바로 그 고백입니다.
- 그래서 여섯 모델의 답이 서로 비슷한 것은 여섯 모델이 실제로 같은 방식으로 추론한다는 증거라기보다, 비슷한 설명 글을 학습했다는 증거일 수도 있습니다.
- 키미의 교차 검증처럼, 설명이 검증의 형식은 갖췄지만 내용은 검증이 아닌 경우도 생깁니다. 그럴듯한 설명과 실제로 일어난 계산은 별개일 수 있습니다.
클로드와 딥시크가 첫머리에 단서를 단 것, 그록이 한계 절을 둔 것은 이 문제를 모델 스스로도 어느 정도 알고 있다는 뜻입니다.
에이전트를 만드는 입장에서 이것이 중요한 이유는, 17장의 CoT나 ReAct에서 모델이 출력하는 “Thought”를 디버깅 로그처럼 믿고 싶어지기 때문입니다. 그 사고 과정은 분명 유용하고, 추론 단계를 먼저 쓰게 하면 실제로 정답률이 올라갑니다. 하지만 그것이 모델 내부에서 일어난 일의 충실한 기록이라는 보장은 없습니다. 그래서 19장의 평가처럼 최종 결과를 바깥에서 검증하는 장치가 여전히 필요합니다. 키미의 mod 5 검산 대신 81과 64를 실제로 계산해 보는 코드 한 줄이 더 믿을 만한 것과 같은 이치입니다.
정리
이러한 주요 LLM을 분석해 보면, 놀라울 만큼 일관된 다단계 추론 틀이 드러납니다. 각 모델은 먼저 프롬프트를 체계적으로 해체해 핵심 작업, 의도, 제약을 파악합니다. 그다음 정교한 패턴 인식으로 정보를 불러오고 종합하는데, 이는 단순한 데이터베이스 조회를 훨씬 넘어섭니다. 흔히 “Chain of Thought”로 표현되는 이 구조화된 과정이 바로 이러한 모델의 인지 능력을 떠받치는 토대입니다.
바로 이 체계적인 단계별 절차가 이러한 LLM을 자율 에이전트의 강력한 핵심 추론 엔진으로 만든다. 에이전트에게는 고수준 목표를 개별 실행 단계로 분해해 줄 신뢰할 만한 중앙 플래너가 필요하다. LLM은 이 계산적 “마음” 역할을 맡아, 문제에서 해법으로 이어지는 논리적 진행을 시뮬레이션한다.
LLM은 전략을 세우고 선택지를 평가하며 구조화된 출력을 만들어 내, 에이전트가 도구와 환경과 효과적으로 상호작용할 수 있게 합니다. 따라서 이러한 모델은 단순한 텍스트 생성기가 아니라 차세대 지능형 시스템을 떠받치는 기반 인지 아키텍처입니다. 결국 이 시뮬레이션된 추론의 신뢰성을 높이는 일이 더 유능하고 신뢰할 수 있는 AI 에이전트를 개발하는 데 무엇보다 중요합니다.
마치며
책은 결론에서 “시뮬레이션된 추론”이라는 표현을 씁니다. 추론이 시뮬레이션이라면, 에이전트 설계자가 할 일은 두 가지입니다. 시뮬레이션이 더 좋은 방향으로 흘러가도록 돕는 것, 그리고 시뮬레이션이 틀렸을 때 잡아내는 것입니다.
앞의 26개 장이 바로 그 두 가지를 위한 도구였습니다. 프롬프트 체이닝, 계획 수립, CoT, 구조화된 출력은 추론이 좋은 방향으로 흘러가도록 틀을 잡아 주고, 리플렉션, 가드레일, 휴먼 인 더 루프, 평가와 모니터링은 추론이 빗나갔을 때 바깥에서 잡아냅니다. 여섯 모델이 스스로 설명한 “해체 → 활성화 → 계획 → 생성 → 검토”라는 틀은, 이 책이 에이전트 바깥에 쌓아 올린 패턴들이 모델 안쪽의 흐름과 같은 모양을 하고 있다는 것을 보여 줍니다. 모델이 한 번의 생성 안에서 흉내 내는 과정을, 에이전트는 여러 번의 호출과 도구와 검증으로 밖으로 꺼내 확인 가능한 형태로 만드는 셈입니다.