18- 즉 에이전트는 부분 관찰 마르코프 결정 과정(POMDP)의 정책을 LLM으로 근사한 것이고, 프롬프트(컨텍스트)가 곧 상태 표현이다.
19- 종료는 별도의 행동 a_t = \text{finish} 또는 최대 스텝 T 도달로 정의한다.
204. Why — 왜 지금 실용화되었는가
21- (1) 추론 능력의 임계점: 사고 사슬(Chain-of-Thought, Wei et al., 2022)이 통하는 규모의 모델부터 "관찰을 근거로 계획을 고치는" 행동이 안정적으로 나온다. GPT-4급 이전 모델은 3~4스텝 안에 계획이 붕괴했다(OpenAI, 2023).
22- (2) 추론+행동의 결합: ReAct(Yao et al., 2023)는 생각(Thought)과 행동(Action)을 번갈아 생성하면 환각이 줄고 HotpotQA·ALFWorld 성능이 크게 오름을 보였다. 루프가 곧 성능이라는 최초의 명확한 증거였다.
23- (3) 도구 호출의 규격화: OpenAI Function Calling(2023-06)과 이후의 tool-use API가 모델 출력을 JSON 스키마에 맞춘 구조화 행동으로 강제했다. 그전까지 파싱은 정규식 노가다였고, 이 불안정성이 최대 병목이었다. Toolformer(Schick et al., 2023)는 도구 호출 자체를 학습할 수 있음을 보였다.
24- (4) 긴 컨텍스트: 히스토리 h_t가 곧 상태이므로, 컨텍스트 길이가 곧 에이전트의 작업 기억 용량이다. 4K → 100K+ 확장이 수십 스텝짜리 작업을 가능하게 했다.
25- (5) 자기 수정: Reflexion(Shinn et al., 2023)은 실패 관찰을 언어적 피드백으로 저장해 다음 시도에 반영하면 HumanEval 정답률이 크게 오름을 보였다.
265. 왜 루프가 수학적으로 필요한가
27- 한 스텝 성공 확률을 p라 하면, 검증 없는 n스텝 파이프라인의 성공률은 p^{n}이다. p=0.95, n=20이면 약 $0.36$.
28- 반면 각 스텝에서 관찰로 검증하고 재시도하면 스텝별 성공률이 1-(1-p)^{k}로 올라간다(k=재시도 횟수).
29- 결론: 긴 작업에서 에이전트가 이기는 이유는 모델이 더 똑똑해서가 아니라 오류를 발견하고 복구할 기회를 반복해서 갖기 때문이다.