11. What — LLM은 결국 '조건부 확률 샘플러'다
2- 대규모 언어모델이 하는 일은 단 하나다. 지금까지의 토큰열 x_{\le t}가 주어졌을 때 다음 토큰의 분포를 계산하고 거기서 샘플링하는 것.
3p_\theta(x_{t+1} \mid x_{\le t})
4- 여기서 \theta는 학습이 끝난 시점에 얼어붙은 파라미터다. 즉 모델이 아는 세계는 사전학습 코퍼스가 잘린 시점(knowledge cutoff)에 박제되어 있다.
5- 이 수식 안에는 "HTTP 요청", "SQL 실행", "파일 쓰기" 같은 외부 상태 변경(side effect)이 들어갈 자리가 없다. 모델의 출력 공간은 오직 어휘 집합 V 위의 토큰뿐이다.
6- 비유하자면 LLM은 도서관에 갇힌 채 전화기도 계산기도 없는 천재다. 방대한 지식을 암기했지만, 창밖 날씨를 확인할 수도 은행 잔고를 조회할 수도 없다.
72. Why — 텍스트 생성만으로는 못 하는 세 가지
8- (a) 최신성 결핍: 오늘의 주가, 30분 전 배포된 API 문서, 방금 들어온 고객 주문은 \theta 안에 없다. 모델은 "모른다"고 말하는 대신 그럴듯한 거짓을 생성하는 경향이 있다 — 환각(hallucination)의 구조적 원인이다 (Ji et al., 2023).
9- (b) 정밀성 결핍: 837291 \times 4472 같은 계산을 모델은 자릿수 알고리즘이 아니라 '패턴 유사도'로 근사한다. 서브워드 토크나이저가 숫자를 임의로 쪼개기 때문에 자릿수 정렬 자체가 깨진다. PAL(Gao et al., 2022)이 "추론은 LLM이, 계산은 파이썬 인터프리터가"라는 분업을 제안한 이유다.
10- (c) 행위 능력 결핍: 텍스트로 "메일을 보냈습니다"라고 쓰는 것과 실제로 SMTP 서버가 메일을 전송하는 것은 완전히 다른 사건이다. 모델은 세계를 기술(describe)할 뿐 변경(act)할 수 없다.
11- 이 세 결핍은 파라미터를 키운다고 사라지지 않는다. 스케일링으로 해결되는 문제가 아니라 입출력 인터페이스의 문제이기 때문이다.
123. Why — 그렇다면 왜 '자유형식 텍스트 파싱'으로는 안 되는가
13- 초기 접근은 모델에게 자연어로 명령을 쓰게 하고, 개발자가 정규식으로 긁어내는 방식이었다. 예: "서울 날씨를 검색해줘" → re.search(r"(.+) 날씨", text).
14- 이 방식이 무너지는 지점들:
15 1. 표현 다양성: "서울 날씨", "Seoul weather", "오늘 서울 기온 어때" — 같은 의도가 무한한 표면형을 가진다. 파서는 항상 뒤늦게 패치된다.
16 2. 타입 부재: "내일"이 문자열인지 날짜인지, 온도 단위가 섭씨인지 화씨인지 텍스트만으로는 알 수 없다.
17 3. 경계 모호성: 모델의 설명 문장과 호출 인자가 한 덩어리로 섞여 나와 어디까지가 인자인지 확정할 수 없다.
18 4. 침묵 실패: 파싱이 틀려도 예외가 나지 않고 잘못된 인자로 실제 API가 호출된다. 결제·삭제 API라면 치명적이다.
19- 핵심 문장: 자유형식 텍스트 파싱만으로는 신뢰할 수 있는 시스템 통합이 불가능하다. 통합의 신뢰성은 "모델이 똑똑한가"가 아니라 "출력이 기계가 검증 가능한 계약(contract)을 따르는가"에 달려 있다.
204. How — Function Calling 메커니즘의 골격
21- 해법의 핵심은 인터페이스를 뒤집는 것이다. 개발자가 함수 스키마(JSON Schema)를 먼저 선언하고, 모델은 자연어가 아니라 그 스키마를 만족하는 구조화된 인자를 생성한다.
22- 4단계 순환:
23 1. 선언: 함수명, 설명, 파라미터 타입/필수 여부를 스키마로 모델 컨텍스트에 주입.
24 2. 생성: 모델이 {"name": "get_weather", "arguments": {"city": "Seoul", "unit": "celsius"}} 형태를 출력.
25 3. 실행: 실행 주체는 모델이 아니라 애플리케이션 런타임이다. 이 분리가 권한 통제와 감사(audit)를 가능하게 한다.
26 4. 재주입: 실행 결과를 관측값으로 다시 컨텍스트에 넣어 최종 답변을 생성.
27- 스키마가 있으면 실행 전에 타입 검증·필수 필드 검사·값 범위 체크가 가능하다. 즉 실패가 침묵하지 않고 호출 전에 드러난다.
28- 이 아이디어의 학술적 뿌리: 모델이 언제 어떤 API를 부를지 자기지도 방식으로 학습한 Toolformer(Schick et al., 2023), 대규모 API 카탈로그에서 올바른 호출을 생성하도록 튜닝한 Gorilla(Patil et al., 2023), 검색 도구를 사람 피드백으로 결합한 WebGPT(Nakano et al., 2021).