2한 문장 요약
3- LLM은 답을 한 번에(one-shot) 뱉으려 할 때 다단계 추론 문제에서 무너지지만, 중간 과정을 말로 풀어 쓰게 하면 같은 모델·같은 가중치로도 정답률이 크게 올라간다 (Wei et al., 2022).
41. 문제 상황 — 한 번에 답하기의 붕괴
5- 언어모델의 출력은 토큰을 하나씩 이어 붙이는 과정이다. 답만 요구하면 모델은 "정답 토큰"을 즉시 확률적으로 골라야 한다.
6- 초등 수준 문장제 문제조차 보통 3~5개의 중간 계산(빼기 → 나누기 → 더하기)을 요구한다. 이 모든 단계를 한 토큰 안에 압축해야 하니 실패한다.
7- 대표 증상 세 가지
8 1. 산술 붕괴: 숫자는 다 읽었는데 최종 수치만 틀림
9 2. 단계 건너뛰기: 조건 중 하나("할인은 회원만")를 무시한 채 결론
10 3. 자신감 있는 오답: 틀린 답을 근거 없이 단정적으로 제시
112. 실제 수치 — GSM8K가 보여준 격차
12- GSM8K는 초등 수학 문장제 8,500여 문제로 구성된 산술 추론 벤치마크다 (Cobbe et al., 2021).
13- Wei et al.(2022)은 동일한 PaLM 540B 모델에 프롬프트만 바꿔 실험했다.
14 - 표준 프롬프팅(답만 요구): 정확도 약 18%
15 - Chain-of-Thought 프롬프팅(풀이 과정 포함 예시 제공): 정확도 약 57%
16- 핵심은 모델을 추가 학습시키지 않았다는 점이다. 파라미터는 그대로고 바뀐 것은 입력 텍스트뿐이다.
17- 즉 성능 향상의 출처는 "모델이 더 똑똑해져서"가 아니라 연산을 수행할 공간(토큰)을 확보해줬기 때문이다.
183. 직관 — 암산 vs 연습장
19- 사람에게 "37 \times 24를 눈 감고 1초 안에 말하라"고 하면 대부분 틀린다. 연습장을 주면 대부분 맞힌다.
20- 능력이 달라진 게 아니라 중간 결과를 저장할 외부 메모리가 생긴 것이다.
21- LLM에게 생성 중인 텍스트는 정확히 그 연습장 역할을 한다. 이미 쓴 토큰은 다음 토큰을 만들 때 다시 읽히므로(자기회귀), 중간 계산이 다음 단계의 입력이 된다.
224. 실무에서 CoT가 쓰이는 자리
23- 코딩 문제 해결: 버그 원인 → 재현 조건 → 수정안 순으로 서술하게 하면 "그냥 고친 코드"보다 회귀 버그가 줄어든다.
24- 법률·계약 문서 추론: 조항 인용 → 사실관계 대입 → 결론 순서를 강제해 근거 없는 단정(할루시네이션)을 억제한다.
25- 다단계 의사결정 지원: 재고 발주, 요금제 선택처럼 조건 분기가 많은 업무에서 판단 근거를 감사(audit) 가능한 형태로 남긴다.
26- 데이터 분석 에이전트: 계획 → 쿼리 → 결과 해석의 단계 기록이 그대로 재현 가능한 로그가 된다.
275. 비용이라는 반대편
28- CoT는 공짜가 아니다. 출력 토큰이 5~10배 늘어나므로 지연 시간과 API 비용이 비례해 증가한다.
29- 단순 분류·추출처럼 한 단계로 끝나는 작업에 CoT를 붙이면 성능은 그대로인데 비용만 오르거나, 과잉 추론으로 오히려 틀리기도 한다.
30- 그래서 실무 판단 기준은 "이 문제가 사람에게도 연습장이 필요한가?"이다.
316. 이어질 질문
32- 여기서 자연스러운 의문이 생긴다. 모델의 가중치는 하나도 바뀌지 않았는데, 왜 '생각을 말로 풀어내는 것'만으로 정답률이 달라지는가?
33- 답의 실마리는 자기회귀 생성의 조건부 확률 구조에 있다. 최종 답 a를 문제 q에서 바로 뽑는 p(a \mid q) 대신, 중간 추론 r을 거치는 p(a \mid q, r)\,p(r \mid q)로 문제를 쪼개는 것이 CoT의 본질이다.
34- 다음 블록부터 이 분해가 왜 더 쉬운 문제가 되는지, 그리고 어떤 프롬프트 형태가 이 분해를 유도하는지를 단계적으로 살펴본다.