12- C = ((x_1,y_1), \dots, (x_k,y_k)): 프롬프트 앞부분에 붙인 시연(demonstration) 예시 k개
13- k=0이면 zero-shot, k \ge 1이면 few-shot이다. 즉 두 방식의 차이는 수식상 조건부에 C가 있느냐 없느냐 하나뿐이다
14Why 1 — 정보량만 바꿔도 성능이 크게 흔들린다
15- GPT-3 논문(Brown 외, 2020)은 파라미터를 고정한 채 k만 0 → 1 → 32로 늘려 여러 벤치마크 점수가 크게 오르는 것을 보고했다. 예를 들어 단어 뜻 맞히기·번역·상식추론 계열에서 zero-shot 대비 few-shot이 수 포인트~수십 포인트 차이를 냈다
16- 반대로 zero-shot만으로도 충분한 태스크가 존재한다는 사실은 GPT-2 논문(Radford 외, 2019)이 먼저 보였다 — "언어모델은 지시만으로 여러 태스크를 수행하는 다중작업 학습기"라는 관찰이다
17- 즉 같은 모델에 같은 질문을 던져도, 예시 유무에 따라 서비스 품질이 갈린다. 그래서 이 구분은 취향이 아니라 설계 결정이다
18Why 2 — 실무: 배포 속도와 비용
19- 사례 A. 고객 문의 자동 분류: 라벨링된 학습 데이터 1만 건을 모으려면 보통 수 주가 걸린다. 반면 담당자가 대표 문의 3건(환불/배송/오류)을 골라 프롬프트에 붙이면 그날 오후에 파일럿 투입이 가능하다
20- 사례 B. 코드 리뷰 자동화: 팀 컨벤션(예: "함수는 30줄 이하", "예외 메시지에 변수명 포함")은 문서로 설명하기 어렵지만, 좋은 리뷰 코멘트 2개를 예시로 보여주면 톤·형식·길이가 즉시 맞춰진다
21- 비용 관점 비교(정성적)
22 - 파인튜닝: 데이터 수집·학습·평가·모델 호스팅 비용이 선불로 발생, 변경 시 재학습 필요
23 - few-shot: 학습 비용 0, 대신 매 호출마다 예시 토큰만큼 입력 비용이 반복 발생
24 - zero-shot: 토큰 비용 최소, 대신 출력 형식이 흔들릴 위험이 가장 큼
25- 정리하면 zero/few-shot은 "학습 비용을 추론 비용으로 바꾸는 거래"다. 트래픽이 적고 요구사항이 자주 바뀌는 초기 서비스일수록 이 거래가 유리하다
26Why 3 — 오해 방지
27- few-shot의 "shot"은 학습 스텝이 아니라 프롬프트 안의 예시 개수다. 메타러닝의 few-shot learning과 이름은 같지만 가중치 갱신이 없다는 점이 다르다
28- 예시를 넣는다고 항상 좋아지지는 않는다. 예시가 편향되거나 라벨 분포가 치우치면 오히려 성능이 떨어진다는 보고가 있다(Zhao 외, 2021; Min 외, 2022)
29- 또한 few-shot의 이득은 모델 규모에 크게 의존한다(Wei 외, 2022) — 작은 모델에서는 예시를 넣어도 이득이 미미할 수 있다
30이 레슨에서 다루는 범위
311. zero-shot이 성립하는 원리와 한계
322. few-shot에서 C가 출력 분포를 바꾸는 방식과 관련 수식
333. 예시 개수 k·순서·형식이 성능에 미치는 영향
344. 선택 기준: 언제 zero-shot으로 충분하고, 언제 few-shot이 필요하며, 언제 파인튜닝으로 넘어가야 하는가
35- 반대로 이 레슨에서 다루지 않는 것: 파인튜닝 학습 루프 구현, RLHF, 에이전트 도구 호출