AI에게 얼마나 생각시켜야 할까?

9월 신모델들이 함께 노출한 추론 강도 다이얼, 작은 팀의 비용과 품질을 가르는 새 설정값입니다.

AI 트렌드 대표 이미지

9월 첫 주는 조용하지 않았습니다.
Anthropic이 9월 1일 Claude Fable 5.1과 Mythos 5.1을, Google이 9월 2일 Gemini 3.8 Flash를, OpenAI가 9월 3일 GPT-6 Astra를 내놨습니다.
그런데 작은 팀이 진짜 눈여겨볼 대목은 벤치마크 순위가 아닙니다.
이번에 나온 모델들이 약속처럼 함께 노출한 추론 강도(reasoning effort) 다이얼입니다.
같은 모델을 쓰더라도 이 다이얼을 어디에 두느냐에 따라, 청구서와 답변 품질이 동시에 달라집니다.

추론 강도 다이얼이 뭐고, 왜 지금 중요할까?

추론 강도는 모델에게 "답하기 전에 얼마나 오래 생각할지"를 지정하는 설정입니다.
생각하는 과정도 출력 토큰으로 계산되기 때문에, 이 값은 사실상 요금 스위치이자 품질 스위치입니다.
독립 측정기관 Artificial Analysis는 Gemini 3.8 Flash를 낮음·중간·높음으로 돌렸을 때 작업당 비용이 0.24달러, 0.41달러, 0.58달러로 약 2.4배 벌어졌고, 지능 점수는 52·57·59였다고 밝혔습니다.
비용은 두 배 넘게 뛰는데 점수는 7점 오르는 구간이 있다는 뜻입니다.

다이얼의 성격도 제품마다 다릅니다.
Claude Fable 5.1은 대화 중간에 메시지 단위로 강도를 바꿔도 캐시가 깨지지 않고, 반대로 GLM-5.3은 "생각 끄기"를 아예 없앴습니다.
Claude Code는 Fable 5.1을 기본 높음으로 돌립니다.
즉 아무 설정도 하지 않은 팀은 이미 누군가가 정해둔 기본값으로 돈을 쓰고 있습니다.

우리 팀은 다이얼을 어디에 맞춰야 할까?

정답은 모델 단위 기본값이 아니라 작업 단위 정책입니다.
기준도 토큰 단가가 아니라 "완료 1건당 비용"으로 바꿔야 합니다.
강도를 높이면 답이 길어지는 데 그치지 않고 도구 호출과 왕복 횟수가 늘어나기 때문입니다.
Artificial Analysis 측정에서 Claude Sonnet 5는 지식 업무 평가에서 최대 강도일 때 낮은 강도보다 약 6배 많은 에이전트 턴을 소비했습니다.

  • 낮음: 문의 분류, 태그 붙이기, 영수증·주문서에서 항목 추출, 상품 설명 요약처럼 정답이 좁은 반복 작업.
  • 중간: 고객 문의 1차 답변 초안, 블로그 초안 개요, 이미 정해진 패턴을 따르는 코드 수정.
  • 높음: 계약서 두 버전 비교, 정산 데이터의 이상 건 추적, 처음 겪는 장애 원인 추정처럼 틀리면 사람이 뒷수습해야 하는 소수 작업.
  • 고정 저가 구간: 대량 분류·정제는 GLM-5.3-Flash, Qwen3.8-Flash 같은 저가·오픈웨이트 계열로 내려도 체감 품질이 유지되는 경우가 많습니다.

이번 주에 당장 뭘 하면 될까?

거창한 재설계는 필요 없습니다.
우리 서비스에서 AI를 부르는 지점을 목록화하고, 각 지점의 기본 강도를 한 줄로 못 박는 것만으로 대부분 정리됩니다.
반나절이면 끝나는 일입니다.

  1. AI 호출 지점을 전부 적고, 각 항목에 "틀리면 누가 뒷수습하나"를 한 줄로 씁니다.
  2. 지점마다 실제 요청 20건을 골든 샘플로 저장합니다.
    잘 되는 것보다 애매한 것을 넣으세요.
  3. 같은 샘플을 낮음·중간·높음으로 각각 돌려 정답률, 완료당 비용, 턴 수를 기록합니다.
  4. 점수 차이가 작으면 낮은 쪽을 기본값으로 채택하고, 코드나 설정 파일에 이유를 함께 남깁니다.
  5. 평가 환경의 강도를 운영 환경과 같게 맞춥니다.
    운영이 중간이면 평가도 중간이어야 비교가 성립합니다.

재측정 트리거도 정해두면 좋습니다.
모델 버전이 바뀔 때, 도입가 프로모션이 끝날 때가 대표적입니다.
예를 들어 Gemini Flash 계열의 도입가는 2027년 1월 1일에 두 배가 되고, OpenAI는 GPT-5.6 Sol의 정가를 출시가보다 내렸습니다.
GPT-6 Astra처럼 더 넓은 강도 범위를 제공하는 신모델도 계속 나옵니다.
다이얼은 새 기능이 아니라 새 책임입니다.
모델 이름을 고르는 일보다, 각 작업에 얼마나 생각을 시킬지 정해두는 일이 이제 더 큰 차이를 만듭니다.

자주 묻는 질문

추론 강도를 항상 높게 두면 안 되나요?
안 되는 건 아니지만 대부분 낭비입니다. Artificial Analysis 측정에서 Gemini 3.8 Flash는 강도를 올릴 때 작업당 비용이 약 2.4배로 늘었지만 지능 점수는 52에서 59로 움직였습니다. 정답이 좁은 반복 작업에서는 품질 곡선이 거의 평평하므로, 어려운 소수 작업에만 높은 강도를 남겨두는 편이 유리합니다.
강도를 낮췄는데 품질이 떨어지면 어떻게 판단하죠?
감이 아니라 골든 샘플로 판단해야 합니다. 작업별로 애매한 실제 요청 20건을 저장해 두고 낮음·중간·높음을 각각 돌려 정답률과 완료당 비용, 왕복 턴 수를 함께 기록하세요. 세 지표를 같이 보면 '싼데 두 번 돌려야 하는' 조합을 걸러낼 수 있습니다.
언제 다시 측정해야 하나요?
모델 버전이 올라갈 때, 그리고 도입가 프로모션이 종료될 때가 기본 트리거입니다. Gemini Flash 계열 도입가는 2027년 1월 1일에 두 배로 오르고, Claude Fable 5.1이나 GPT-6 Astra처럼 강도 동작 방식이 다른 신모델도 계속 등장합니다. 기본값과 측정 결과를 설정 파일에 기록해두면 재측정 비용이 크게 줄어듭니다.