3- 모델의 가중치를 더 키우거나 더 학습시키는 대신, 답을 만들 때 쓰는 계산량을 늘려 정답률을 높이는 전략입니다.
4- 구체적으로는 하나의 문제에 대해 여러 개의 추론 경로(reasoning path)를 만들고, 이를 투표(Self-Consistency)하거나 탐색(Tree-of-Thought)해서 최종 답을 고릅니다.
5- 기존 Chain-of-Thought(CoT)는 "생각을 적어라"였다면, 추론 확장은 "생각을 여러 번, 여러 갈래로 적고 그중 좋은 것을 고르라"입니다 (Wei et al., 2022 → Wang et al., 2022 → Yao et al., 2023).
62. Why — 단일 경로 CoT는 왜 깨지기 쉬운가
7- 표준 CoT는 greedy decoding으로 단 하나의 경로만 생성합니다. 이 경로는 문제 전체를 관통하는 직렬 사슬이라, 중간 한 스텝만 틀려도 이후 스텝이 모두 오염됩니다.
8- 각 추론 스텝이 독립적으로 확률 1-\epsilon 로 맞는다고 단순화하면, n 스텝짜리 풀이가 전부 맞을 확률은
9
P_{correct} = (1-\epsilon)^{n}
10- 스텝 정확도가 95%여도 10스텝이면 0.95^{10} \approx 0.60 으로 떨어집니다. 즉 길고 사소한 실수 하나가 전체 답을 죽입니다(예: "12 × 3 = 36"을 "12 × 3 = 34"로 계산).
11- 게다가 greedy 경로는 지역 최적(local optimum)에 갇힙니다. 앞부분에서 잘못된 접근을 잡으면 되돌아갈(backtrack) 방법이 없어, 사람은 "아 이 방법 아니네" 하고 되돌아가는데 LLM은 끝까지 밀고 갑니다.
12- 핵심 관찰: 정답에 이르는 길은 여러 개지만, 오답은 제각각으로 흩어진다. 그래서 샘플링을 여러 번 하면 정답이 다수결로 수렴합니다. 이것이 추론 확장의 한 줄 요약입니다.
133. How — 두 갈래 접근
14- Self-Consistency (Wang et al., 2022): temperature를 올려 k개(보통 5~40)의 CoT를 샘플링한 뒤, 최종 답만 모아 다수결. 확률적으로는 추론 경로 z를 잠재변수로 보고 주변화(marginalization)하는 것에 해당합니다.
16- Tree-of-Thought (Yao et al., 2023): 추론을 트리로 펼쳐 각 중간 상태를 LLM 스스로 평가(value)하고, BFS/DFS로 유망한 가지만 확장하며 막히면 되돌아갑니다.
17- 차이 요약: Self-Consistency는 사후 투표(경로 간 상호작용 없음), Tree-of-Thought는 탐색 중 가지치기와 백트래킹(경로가 서로 정보를 줌).
184. 실제로 얼마나 오르는가 (실증 사례)
19- GSM8K 초등 수학 서술형: PaLM 540B에서 CoT 56.5% → Self-Consistency 74.4% (약 +17.9%p, Wang et al., 2022). GPT-3 계열에서도 두 자릿수 향상.
20- Game of 24 퍼즐(4개 숫자로 24 만들기): GPT-4 CoT 성공률 4% → Tree-of-Thought 74% (Yao et al., 2023). 되돌아가기가 결정적인 과제일수록 격차가 큼.
21- 코드 생성: 여러 후보를 뽑아 테스트 통과 여부로 고르는 방식(AlphaCode의 대량 샘플링 + 필터링, Li et al., 2022)도 같은 원리의 사촌.
22- OpenAI o1/o3: 답하기 전에 긴 내부 추론을 생성하고 검증하는 test-time compute scaling으로, "추론 시간에 계산을 더 쓸수록 성능이 로그 스케일로 오른다"는 곡선을 보였습니다(OpenAI, 2024; Snell et al., 2024).
235. 공짜는 아니다 — 비용 트레이드오프
24- k개 경로를 뽑으면 토큰 비용과 지연(latency)이 대략 k배. Tree-of-Thought는 평가 호출까지 더해져 수십~수백 배가 되기도 합니다.
25- 따라서 실무 기준: 답이 하나로 검증 가능하고(수학·코드·논리), 오답 비용이 큰 과제에만 선택적으로 적용하는 것이 합리적입니다.
26- 비유: 시험에서 한 번 풀고 바로 제출(greedy) vs 세 번 풀어 답 비교(Self-Consistency) vs 여러 접근을 시도하다 막히면 지우고 다시(Tree-of-Thought).