ChatGPT·Claude 등 AI 토큰을 줄이는 방법: 웹앱과 API별 실행 순서

AI
Image by Alexandra_Koch from Pixabay

AI 토큰을 줄이려면 프롬프트에서 중복과 불필요한 배경 설명을 빼고, 답변 분량을 제한하면 됩니다. 대화가 길어졌다면 핵심만 요약해 새 대화로 옮기고, API를 운영 중이라면 사용량을 측정한 뒤 반복 입력에 캐싱을 검토하세요.

토큰은 AI가 문장과 일부 멀티모달 입력을 처리하기 위해 나누는 단위입니다. 공백, 문장부호, 단어 일부도 토큰이 될 수 있으며, 제공업체와 모델의 토크나이저가 다르기 때문에 같은 한국어 문장의 토큰 수가 ChatGPT·Claude·Gemini에서 같다고 볼 수는 없습니다.

일반 웹앱에서는 API처럼 매 요청의 입력·출력 토큰 수나 최대 출력 토큰을 항상 직접 설정할 수 있다는 공식 근거를 확인하지 못했습니다. 따라서 ChatGPT나 Claude 웹앱에서는 프롬프트와 대화 이력을 줄이는 방법이 우선이고, 세부적인 측정과 상한 설정은 API에서 더 분명하게 적용할 수 있습니다.

핵심 요약: 목표·필요한 자료·조건·출력 형식을 한 번에 짧게 적고, 답변의 최대 분량을 지정하세요. API라면 입력·출력·캐시·추론 토큰을 따로 기록해야 실제 절약 여부를 판단할 수 있습니다.

AI 토큰을 줄이려면 어떤 순서로 설정해야 하나요?

먼저 웹앱과 API 중 어떤 환경을 쓰는지 구분하세요. 웹앱은 화면에서 직접 조절할 수 있는 항목이 제한적일 수 있고, API는 출력 상한과 사용량 정보를 요청 단위로 관리할 수 있습니다. 아래 순서대로 적용하면 입력을 줄인 뒤 결과 품질을 확인하면서 조정할 수 있습니다.

  1. 작업 목표를 한 문장으로 씁니다. 예를 들어 ‘아래 계약서에서 해지 조건만 5개 항목으로 요약해줘’처럼 대상, 작업, 결과 형식을 함께 지정합니다. ‘자세히 설명해줘’처럼 범위가 열린 표현은 필요 이상으로 긴 답변을 만들 수 있습니다.
  2. 인사말, 배경 설명, 이미 전달한 조건과 반복되는 강조 문구를 삭제합니다. 역할·목표·입력 자료·제약 조건·출력 형식을 짧게 정리하고 같은 지시를 여러 번 넣지 않습니다.
  3. 답변 길이를 제한합니다. 웹앱에서는 ‘핵심만 5문장’, ‘3개 항목으로’, ‘각 항목 한 문장’처럼 요구하고, API에서는 사용하는 제공업체의 출력 제한 옵션을 설정합니다.
  4. 대화가 길어지면 지금까지의 핵심 결정과 남은 과제만 요약해 새 대화로 옮깁니다. 오래된 대화 전체를 계속 참조하게 하는 대신 필요한 요약본만 전달하면 반복 입력을 줄일 수 있습니다.
  5. API 사용자는 호출 후 입력 토큰과 출력 토큰을 기록합니다. OpenAI는 API 응답의 usage나 사용량 대시보드를, Gemini는 count_tokens와 usage_metadata를 활용해 확인합니다.
  6. 동일한 긴 시스템 지침이나 문서를 여러 번 보내는 API 애플리케이션이라면 프롬프트 캐싱을 검토합니다. 캐시 쓰기 비용, 유지 시간, 적중 비용과 실제 적중률을 함께 확인한 뒤 적용 여부를 판단합니다.
목표: [무엇을 할지]
입력: [작업에 필요한 자료만]
조건: [언어·대상·금지사항]
출력: [형식과 최대 분량]
불확실한 내용은 추측하지 말고 표시

위 템플릿은 웹앱과 API 모두에 사용할 수 있습니다. 결과가 부족할 때만 추가 질문을 보내고, 처음부터 모든 가능성을 설명하라고 요구하지 않는 것이 좋습니다. API별 이름은 다릅니다. Anthropic에서는 max_tokens, Gemini에서는 maxOutputTokens로 출력 상한을 설정하며, 너무 낮게 잡으면 답변이 중간에 끊길 수 있으므로 결과도 함께 확인해야 합니다.

토큰 절약이 실제로 적용됐는지 어떻게 확인하나요?

웹앱에서는 정확한 토큰 수가 항상 표시된다고 보기 어렵기 때문에 전후의 입력 길이, 대화 turns 수, 답변 분량과 결과 품질을 비교하세요. 같은 작업을 비슷한 조건으로 실행했을 때 프롬프트가 짧아지고 답변도 필요한 범위 안에 들어오는지 확인하면 됩니다.

  1. 웹앱에서는 기존 프롬프트에서 반복 문장과 불필요한 자료를 뺀 뒤 같은 요청을 다시 실행합니다.
  2. 답변이 지정한 문장 수나 항목 수를 지키는지 확인합니다. 내용이 빠졌다면 출력 상한을 조금 높이거나 필요한 조건만 추가합니다.
  3. API에서는 입력·출력·캐시·추론 토큰을 가능한 범위에서 각각 기록합니다. OpenAI API 응답에는 prompt_tokens, completion_tokens, total_tokens가 포함될 수 있고 cached_tokens나 reasoning_tokens 같은 세부 항목이 제공될 수 있습니다.
  4. Gemini API에서는 요청 전에 count_tokens로 입력량을 계산하고, 실행 후 usage_metadata에서 입력·출력·캐시·사고 토큰 등의 사용량을 확인합니다.
  5. 캐싱을 적용했다면 캐시 적중률과 응답 품질을 적용 전과 비교합니다. 캐시를 켰다는 사실만으로 항상 비용이 줄었다고 판단하지 않습니다.

제공업체별 토큰 수와 비용은 단순 비교하면 안 됩니다. 모델별 토크나이저, 입력·출력 비율, 캐시 적중률, 추론 토큰, 플랜과 과금 조건이 다르기 때문입니다. 또한 일반 ChatGPT·Claude 웹앱의 사용자별 실시간 토큰 표시와 세부 상한 메뉴는 이번에 확인한 공식 자료만으로 특정할 수 없으므로, 화면에 없는 기능을 임의로 찾기보다 프롬프트 길이와 대화 이력을 줄이는 방식부터 적용하는 것이 안전합니다.

IT에 게시됨