챗봇 개발 시 비용 절감을 위해 레포분석 같은 무거운 작업은 소넷, 나머지 잡무는 하이쿠로 나눠쓴다는 얘기로 시작. GPT-5.4, 제미니 플래시, 딥시크 등 다양한 모델의 가성비를 비교했고, Qwen을 로컬(맥스튜디오)로 돌리면 동시 요청 시 매우 느려진다는 실측 경험이 공유됨. 결국 컨텍스트 크기와 챗봇 목적에 따라 맞는 모델이 다르므로 여러 개 써보고 고르는 게 낫다는 결론.
- 소넷은 레포분석 등 무거운 작업, 하이쿠는 잡담·경량 작업에 배분해 비용 절감
- Qwen을 로컬 맥스튜디오로 돌리면 동시 요청 시 초당 10토큰도 안 나올 정도로 느림
- 딥시크는 저렴하고 성능도 괜찮아 엑셀 정리 같은 간단한 용도엔 충분
- 비동기+로그불필요 작업은 클로드코드에 물리고, 실시간 필요시엔 GPT API를 추천