저번에 Semantic Router를 검토하면서 이런 생각을 적었다.Classification은 생성형 AI가 상용화되기 이전부터 인공지능 모델이 잘하던 작업이다. 출력이 정해진 라벨 중 하나라면 모든 요청을 LLM에 보내야 할 이유는 없다. https://jjjjqqq.tistory.com/115 LLM을 덜 호출하는 시스템 설계: Semantic Router와 CacheLLM 에이전트를 운영하면서 가장 자주 고민하게 되는 문제 중 하나는 비용이다.트래픽이 늘어나면 LLM 호출 비용도 거의 선형으로 증가한다. 호출량을 줄이지 않은 채 더 저렴한 모델만 찾는 방식jjjjqqq.tistory.com 예를 들어 사용자의 요청을 order_status, refund_request, technical_supp..