최근 PyTorchKR에서 정리한 논문들 보니까 이전처럼 무작정 모델 크기 키우는 걸 넘어서 효율성에 집중하는 추세더라고요. 멀티스트림 LLMs는 읽기, 생각, 출력 과정을 병렬로 분리해 기존 언어 모델의 단일 스트림 한계를 극복했고, CODA는 트랜스포머의 메모리 이동 병목을 줄이기 위해 자잘한 연산들을 GPU 커널의 단일 흐름으로 묶어냈습니다. SlimQwen은 대규모 전문가 혼합 모델의 사전학습 단계에서부터 가지치기와 지식 증류를 적용해 실용적인 수준으로 압축하는 최적의 궤적을 제시했습니다.
뭔가 진짜 실무에 써먹을 수 있는 느낌이 드는데, 개인 프로젝트나 스타트업 환경에서도 참고할 만한 내용들이 있을까요? 이번 주 연구들은 AI 에이전트가 단순히 텍스트를 생성하는 도구를 넘어, 시스템의 핵심 인프라로 자리 잡고 스스로 발전하는 모습을 보여줍니다. AIRA와 EvolveMem은 에이전트가 스스로 신경망 아키텍처를 설계하거나 메모리 검색 파이프라인을 자율적으로 진화시키는 AutoResearch의 가능성을 성공적으로 입증했습니다. 여기 나오는 논문들 실제로 읽어보신 분들 있으면 후기 좀 부탁드려요.