지난 몇 달 사이 LLM 모델 출시가 정말 미친 속도로 쏟아져 나오더라고요. 제가 정리한 걸 한번 봐주세요.
7월 말부터 8월 말까지 한 달 남짓 사이에 SK텔레콤의 A.X K2, LG AI연구원의 K-EXAONE 2.0, DeepSeek의 V4-Flash, 모티프테크놀러지스의 Motif-3, Alibaba Qwen의 3.8-Flash-Next, Zhipu의 GLM-5.3-Flash가 연달아 공개됐어요. 근데 이게 다가 아니라는 게 압박입니다 ㅎㅎ
6월 기준으로는 Google Gemma 4와 Alibaba Qwen3.6이 출시되기도 했고, 특히 Qwen3.6은 MMLU 84%, 262K 컨텍스트, 201개 언어 지원하는 수준인데 진짜 무섭더라고요. 이 정도면 로컬에서 실용적으로 돌릴 수 있는 수준이 됐다는 얘기거든요.
더 충격적인 건 추론 API의 중앙값 가격이 2023년 1분기 백만 토큰당 약 30달러에서 2026년 1분기 0.5달러 아래로 내려왔다는 거예요. 진짜 가격 떨어지는 속도가 미쳤어요. 예전에는 AI 써봤자 비용이 장난 아니었는데 이제 취미로도 써볼 수 있겠네요.
근데 여기서 제가 궁금한 게 있거든요. 이렇게 모델이 많이 나오니까 뭘 어떻게 선택해야 할지 모르겠어요. 로컬에서 쓸 거면 어떤 모델 쓰시는 분들이 많으신가요? 이왕 돌릴 거면 성능 대비 가성비 좋은 걸로 고르고 싶은데 추천 부탁드립니다.