Cloud Cost Sense
Vertex AI Gemini API 비용: 출시 전 토큰 추정
입력 토큰, 출력 토큰, 캐시된 컨텍스트, grounding, 재시도, 백엔드 사용량을 나눠 Vertex AI의 Gemini API 비용을 계획하는 방법입니다.
요청 수보다 토큰부터 모델링하세요
월간 사용자 수부터 보지 말고 제품 동작부터 나누세요. 채팅, 요약, 검색, AI 어시스턴트 경로마다 평균 입력 토큰, 예상 출력 토큰, 첨부 미디어, 세션당 호출 수, 사용자당 세션 수, 월간 활성 사용자 수를 추정합니다.
긴 프롬프트, 대화 기록, 시스템 지시문, 검색으로 붙는 문서도 추정에 포함하세요. 사용자 수가 작아도 매 요청마다 큰 컨텍스트를 보내거나 긴 답변을 만들면 비용이 의미 있게 커질 수 있습니다.
캐시된 컨텍스트와 grounding을 분리하세요
반복되는 지시문, 제품 문서, 예시, 정책 텍스트는 매번 전체 입력으로 보내기보다 캐시할 수 있을 때 더 저렴해질 수 있습니다. 캐시된 입력을 별도 항목으로 두면 프롬프트 재사용이 실제로 비용을 줄이는지 확인하기 쉽습니다.
Grounding, 검색, Maps, 기타 도구 호출은 기본 모델 토큰 외의 비용을 만들 수 있습니다. 외부 사실 확인이 얼마나 자주 필요한지, 사용자 동작 하나가 몇 번의 grounded query를 만들 수 있는지, 모든 흐름에 기본으로 grounding이 필요한지 따로 추정하세요.
출시 전 백엔드 가드레일을 추가하세요
AI 비용은 단독으로 움직이지 않는 경우가 많습니다. Cloud Run 요청 시간, 큐 worker, Firestore 또는 Cloud SQL read/write, Storage 업로드, 로그, 재시도를 같은 시나리오에 넣으세요. 실패한 재시도와 스트리밍 재연결은 전환을 높이지 않으면서 모델 호출만 곱할 수 있습니다.
출시 전에는 사용자별 한도, 최대 출력 토큰, 요청 타임아웃, 악용 탐지, 결제 알림을 설정하세요. 그런 뒤 계산기에서 평상시와 스파이크 시나리오를 비교해 모델 사용량, DB 트래픽, 컴퓨팅 가드레일을 함께 검토하세요.