Deep Learning + AI
Gemini api 관련 개념_ Context Caching
내인생왜이래
2026. 3. 6. 13:12
반응형
1. 캐싱의 필요성?
AI와 대화할 때, 우리는 종종 엄청나게 긴 문서(법전, 소설 전권, 수천 줄의 코드)를 입력으로 줍니다.
- 기존 방식: 질문을 할 때마다 AI는 그 긴 문서를 처음부터 다시 읽어야 합니다. 10페이지짜리 서류에서 1번 질문을 하고, 이어서 2번 질문을 해도 AI는 다시 1페이지부터 읽습니다.
- 단점: 시간이 오래 걸리고(지연 시간), 읽을 때마다 비용(토큰 비용)이 발생합니다.
2. Context Caching의 작동 원리
'단골 손님이 있는 식당'에 비유
① 데이터 분석 및 저장
손님이 식당에 올 때마다 "저는 견과류 알러지가 있고, 오이는 싫어하며, 스테이크는 미디엄 레어로 구워주세요"라고 5분 동안 설명한다고 가정해 봅시다.
- 캐싱 적용: 식당 주인이 이 요청 사항을 메모지(Cache)에 적어 포스기 옆에 붙여둡니다. 이것이 '캐싱'의 시작입니다.
② 토큰 연산 결과 보관
AI 내부적으로는 텍스트를 숫자로 변환하고 복잡한 수학 계산을 거칩니다. 캐싱은 이 계산 결과값(KV Cache)을 서버의 빠른 메모리에 딱 고정해 둡니다.
- 예시: 수만 권의 판례 데이터를 미리 읽어두고, 그 분석 데이터를 메모리에 상주 시킵니다.
③ 재사용
이제 손님이 들어오기만 하면 주인은 메모를 보고 즉시 요리를 시작합니다.
- 결과: "저번에 말한 대로 해줘" 한마디에 AI는 이미 읽어둔 데이터를 바탕으로 초고속 답변을 내놓습니다.
3. Context Caching 진행 방식
1단계: Context 준비 (사전 통째로 외우기)
우리가 정의한 [Shade Guide Code Dictionary]는 AI가 매번 읽기에는 양이 많고 복잡한 규칙
- 일반적인 방식: 사진 한 장을 보낼 때마다 "이게 Vita Classic인지, Ivoclar인지 이 리스트를 보고 판단해!"라고 매번 사전 데이터를 같이 보냅니다. (매번 읽느라 느리고 돈이 많이 듦)
- Context Caching 방식: AI에게 미리 이 딕셔너리와 매핑 로직(Prefix 규칙 등)을 입력하고 '캐시(Cache)' 처리합니다. AI는 이제 이 규칙을 완벽히 숙지한 상태로 대기합니다.
2단계: 이미지 입력 및 추출 (현장 관찰)
사용자가 치과 지시서 사진을 업로드합니다. 캐싱된 상태의 AI는 이미 규칙을 알고 있으므로, 사진에서 필요한 정보만 즉시 찾습니다.
- 작업: '절단(Incisal)', '중간(Middle)', '치경부(Cervical)' 옆에 적힌 글자(예: A2, 3M2)를 추출합니다.
- 상태: 아직은 브랜드가 무엇인지 확정되지 않은 순수 데이터 상태입니다.
3단계: 캐시된 로직 적용 (고속 대조 및 태깅)
여기서 Context Caching의 진가가 발휘됩니다. AI는 메모리에 저장된 딕셔너리를 빛의 속도로 훑습니다.
- 비교 대조: 추출된 '3M2'가 어느 브랜드인지 캐시된 데이터에서 찾습니다. -> 결과: "Vita 3D Master"
- 브랜드 확정: shade_guide_code에 "Vita 3D Master"를 넣습니다.
- Prefix 결합: 캐시된 규칙에 따라 3D라는 접두어를 '3M2' 앞에 붙여 3D3M2라는 최종 엔지니어링 코드를 완성합니다.
4단계: 결과 출력 (최종 보고)
모든 연산이 끝나면 다음과 같은 구조화된 데이터를 내놓습니다.
필드명 추출된 값 로직 적용 결과 (캐시 활용)
| shade_guide_code | - | Vita 3D Master |
| detail_shade_code_incisal | 3M2 | 3D3M2 |
| detail_shade_code_middle | 3M1 | 3D3M1 |
일반적인 프롬프트 입력과의 차이 요약
- 논리적 일관성: 로직이 캐싱되어 있으므로, AI가 매번 규칙을 다르게 해석할 여지(Hallucination)가 줄어듭니다.
- 지연 시간(Latency) 단축: 수천 명의 치과 의사가 동시에 사진을 올려도, AI는 이미 규칙을 '외우고' 있기 때문에 연산량이 대폭 줄어들어 즉각적인 응답이 가능합니다.
- 확장성: 만약 새로운 브랜드(예: Shofu)가 추가된다면, 전체 시스템을 고치는 게 아니라 캐시된 딕셔너리만 업데이트하면 즉시 현업 솔루션에 적용됩니다.
반응형