LLM 에이전트를 운영하면서 가장 자주 고민하게 되는 문제 중 하나는 비용이다.트래픽이 늘어나면 LLM 호출 비용도 거의 선형으로 증가한다. 호출량을 줄이지 않은 채 더 저렴한 모델만 찾는 방식에는 한계가 있다.Azure OpenAI의 PTU는 예약 할인을 적용하더라도 확보한 처리 용량만큼 비용이 발생한다. 결국 단가 최적화뿐 아니라 필요한 PTU 규모 자체를 줄이는 설계가 필요하다.처음에 생각했던 내용은 단순했다.Classification은 생성형 AI가 상용화되기 이전부터 인공지능 모델이 잘하던 작업이다. 출력이 정해진 라벨 중 하나라면 모든 요청을 LLM에 보내야 할 이유는 없다.에이전트 구조의 일부는 discriminative model만으로도 충분하거나, 이를 보조적인 수단으로 활용할 수 있어 ..