최근 논문들 보면 모델 크기 키우는 것보다 효율성 쪽으로 확 쏠린 분위기더라고요. 단 13개의 훈련 매개변수만으로도 모델 성능을 90% 이상 회복하는 기술들이 나오고 있거든요.
요즘 추세를 보면 크게 세 가지 정도가 눈에 띄는데, 하나는 에이전트가 스스로 환경에 적응하고 자율적으로 행동하는 구조고, 다른 하나는 에이전트가 신경망 아키텍처를 스스로 설계하거나 메모리 검색을 자동으로 진화시키는 방향이네요. 그리고 FP32에서 FP8, 이제 FP4 수준의 저정밀 연산이 학습까지 적용되는 흐름도 중요해 보여요.
기존처럼 무식하게 규모만 키우는 방식은 이제 끝나가는 것 같습니다. 비용이나 환경 이슈 때문에라도 효율 중심으로 가야 하니까요.