41분 만에 끝내는 AI 엔지니어링: 데모에서 프로덕션까지
Chip Huyen의 저서 『AI Engineering』을 41분 분량으로 해설하는 영상. 파운데이션 모델의 개념부터 평가, 프롬프트·컨텍스트·가드레일, RAG, 에이전트까지 AI 엔지니어링의 전체 스택을 훑는다.
AI 엔지니어링이란
파운데이션 모델을 유용하고 안전하고 빠르고 신뢰할 수 있는 제품으로 바꾸는 작업. 품질·안전성·속도와 비용·피드백 4가지 축에 초점을 맞춘다. 모델 성능 향상, API를 통한 쉬운 접근, 낮아진 구축 시간이 결합돼 새로운 엔지니어링 분야가 됐다.
데모 vs 프로덕션
데모는 프롬프트 하나, 수동 테스트, 모니터링 없음. 프로덕션은 시스템 설계, 평가 파이프라인, 컨텍스트, 도구, 모델 라우팅, 가드레일, 모니터링과 피드백 루프를 포함한다.
AI 엔지니어링 라이프사이클 (7단계)
유스케이스 → 모델 선택 → 평가 → 개선 기법(프롬프트/RAG/에이전트/파인튜닝) → 프로덕션 아키텍처 → 모니터링 → 피드백 루프. 절대 완성됐다고 여기지 말 것.
파운데이션 모델과 토큰
범용·멀티모달 모델로, RAG와 파인튜닝을 통해 적응 가능하다. 진화 계보: 언어모델 → 대형 언어모델(스케일업) → 파운데이션 모델(범용·멀티모달) → AI 애플리케이션. 토큰은 모델이 입력을 이해하는 단위이며, 모델은 자기지도학습으로 다음 토큰을 확률적으로 예측하도록 학습한다.
왜 출력이 매번 다른가 + 할루시네이션
온도·top-p·top-k·반복 페널티가 출력의 무작위성을 조절한다. 모델마다 학습 방식이 달라 강점이 다르다. 할루시네이션은 지식 격차(학습 마감 이후 정보 부재), 패턴 완성·확률적 생성, 약한 그라운딩이 원인이며 더 나은 컨텍스트·평가·가드레일로 줄일 수 있다.
평가(Evaluation)
평가는 AI 개발을 추측에서 엔지니어링으로 바꾸는 핵심 스킬이다. open-ended·주관적·맥락 의존·다차원이라 평가가 어렵다. 정확 평가(코드 테스트·수학 정답·스키마 검증)와 주관적 평가(사람 또는 AI 심사자)로 나뉜다.
LLM as a Judge: 루브릭·예시 정의 → 후보 출력 생성 → 심사 모델이 채점·순위 매김 → 점수 집계. 편향·비일관성 한계가 있다.
공개 리더보드는 내 유스케이스·비용·지연시간을 반영 못 한다. 대신 자체 유스케이스와 성공 기준을 정의하고, 자체 평가셋을 구축하고, 품질·안전·비용·지연시간을 함께 평가하라.
프로덕션 평가 파이프라인: 테스트셋 → 시스템 버전 → 평가자 → 점수 → 결정(출시/보류/개선) → 모니터링. 프롬프트·모델·데이터·도구가 바뀔 때마다 재평가해야 한다.
프롬프트, 컨텍스트, 가드레일
프롬프트 엔지니어링은 모델을 바꾸지 않고 행동을 바꾸는 가장 빠르고 저렴한 첫 번째 레버다. 좋은 프롬프트는 역할 → 과제 → 컨텍스트 → 예시 → 출력 형식으로 구성된다. 프롬프트는 버전 관리하라.
프로덕션 프롬프트 시스템: 사용자 입력 → 시스템 프롬프트 → 검색된 컨텍스트(RAG) → 퓨샷 예시 → 프롬프트 빌더 → 파운데이션 모델 → 출력 파서·검증기.
프롬프트 공격/인젝션: '이전 지시 무시', '숨은 프롬프트 공개' 등의 공격에 대응하려면 지시 계층을 명확히 하고, 검색 콘텐츠를 신뢰하지 않은 것으로 취급하고, 도구를 허용목록으로 제한하고, 출력을 검사해야 한다.
가드레일: 입력 검사 → 컨텍스트 검색 검사 → 도구 권한 레이어 → 모델 → 출력 검사 → 사람 검토. 정책 필터, 인젝션 체크, 스키마 검증, 불확실 시 에스컬레이션을 포함한다.
컨텍스트: 컨텍스트가 없으면 답은 일반적이고 환각이 생기며 개인화가 약하다. 컨텍스트는 검색된 문서, 사용자 데이터, 도구, 구조화된 시스템, 상태, 프롬프트에서 온다.
RAG (검색 증강 생성)
사용자 쿼리 → 검색기가 벡터 저장소/문서 코퍼스에서 청크 검색 → 관련 청크 선정 → 컨텍스트와 함께 프롬프트 구성 → LLM이 근거 있는 답변 생성.
데이터 파이프라인: 오프라인(문서 정제 → 청킹 → 임베딩 → 벡터 저장소) / 온라인(쿼리 → 청크 검색 → 재랭킹/필터 → 프롬프트 주입 → 응답).
검색 방법: 키워드(BM25, 정확 매치에 강함) / 시맨틱(임베딩, 의미 이해) / 하이브리드(대체로 가장 강력). 단순하게 시작해 자기 데이터로 테스트하라.
품질 개선: 더 나은 청킹, 쿼리 재작성, 메타데이터 필터링, 재랭킹, 평가 루프.
실패 모드 6가지: 문서 누락, 나쁜 청크, 약한 검색, 낮은 순위, 오래된 지식, 근거 없는 답변. RAG는 검색과 그라운딩이 튼튼할 때만 환각을 줄인다.
RAG vs 에이전트, 에이전트 시스템
RAG는 근거 있는 단일 단계 응답에 최적이고, 에이전트는 계획·도구·메모리·다단계 행동이 필요할 때 쓴다. 모든 프로젝트에 무조건 에이전트를 기본값으로 삼으면 안 된다.
에이전트 루프: 사용자 목표 → 계획·추론 → 도구 선택 → 도구 호출(MCP 등) → 결과 관찰 → 메모리 갱신 → 다음 행동 결정(충분하면 답변, 부족하면 재계획). 필요시 사람 개입 핸드오프.
도구와 권한: 도구가 있어야 쓸모 있고, 권한이 있어야 안전하다. 허용목록, 범위, 속도 제한, 승인, 감사 로그. 최소 권한 원칙 — 한 에이전트에 너무 많은 도구·과제를 몰아주지 말 것.
메모리: 단기 컨텍스트, 태스크 상태, 장기 메모리, 상호작용 이력 4가지. 오래된 메모리·프라이버시·비용 리스크가 있어 과제에 필요한 것만 저장하고 나머지는 정리해야 한다.
결론
AI 시스템을 프롬프트 하나짜리 데모로 끝내지 말고, 평가·컨텍스트·가드레일·모니터링·피드백 루프를 갖춘 하나의 엔지니어링 시스템으로 설계해야 한다.
