10월 9일 구글 제미나이 무료 사용 제한? 바뀐 핵심 요금제 총정리
인공지능 모델의 성능을 향상시키기 위해 무조건 거대한 매개변수를 가진 모델만을 고집하던 시대는 지나갔습니다. 구글 연구진이 선보인 '툴그래드-500(ToolGrad-500)' 데이터셋은 고품질의 소규모 합성 데이터만으로도 12B 규모의 경량 모델이 거대 상용 AI 모델들과 대등하거나 이를 능가하는 도구 활용 성능을 발휘할 수 있음을 입증했습니다.
| 거대 상용 AI 압도한 젬마3 12B |
구글 연구진은 경량 교사 모델인 제미나이 2.5 플래시-라이트(Gemini 2.5 Flash-Lite)를 활용하여 단 500개의 고품질 도구 연동 샘플로 구성된 'ToolGrad-500' 데이터셋을 구축했습니다. 그리고 이 정제된 데이터셋을 바탕으로 공개 오픈소스 모델인 젬마-3(Gemma-3)의 1B, 4B, 12B 매개변수 모델을 미세조정(Fine-tuning)했습니다.
평가는 실제 훈련 과정에서 접해보지 않은 생소한 API 도구 환경에 얼마나 잘 적응하는지 측정하는 업계 표준 벤치마크인 버클리 함수 호출 리더보드(BFCL v1/v2)에서 엄격하게 진행되었습니다.
실험 결과, 단 500개의 데이터 샘플로 학습된 ToolGrad-12B 모델은 BFCL 벤치마크에서 83.1점을 기록했습니다. 이는 세계 최고 수준의 글로벌 최신 상용 모델들과 어깨를 나란히 하거나 오히려 뛰어넘는 수치입니다.
이번 실증 연구에서 가장 놀라운 발견은 '지능 자승(Intelligence Bootstrap)' 또는 '자아 진화(Self-evolving)' 현상입니다. 데이터를 생성한 스승(Teacher) 모델인 '제미나이 2.5 플래시-라이트'의 성능점수는 76.2점이었습니다. 그러나 이 교사 모델이 만든 툴그래드-500 데이터셋으로 학습한 학생(Student) 모델인 Gemma-3-12B는 83.1점을 기록하며 스승 모델을 무려 6.9점 차이로 압도했습니다.
이는 올바르고 정제된 도구 연동 트레이스 데이터가 주어진다면, 소형 학생 모델이 교사 모델의 단순한 복제를 넘어 스스로 최적의 도구 호출 및 정렬 능력을 학습할 수 있음을 명백히 입증한 것입니다.
실제 로컬 테스트 환경에서 날씨 조회, 환율 계산, 뉴스 검색이 복합적으로 결합된 다단계 지시문 테스트를 수행해 보았습니다. 기존 Gemma-3-12B 베이스 모델은 존재하지 않는 파라미터를 입력하거나 중도에 연쇄 호출을 중단하는 환각(Hallucination) 현상을 보였습니다. 그러나 ToolGrad-12B 모델은 단 한 번의 요청(One-shot)만으로 필요한 3가지 API 호출 JSON 구조를 오류 없이 정확히 생성해 내는 것을 확인할 수 있었습니다.
경량화된 12B 규모 모델로도 거대 클라우드 API에 의존하지 않고 고성능 에이전트를 구축할 수 있게 됨에 따라, 기업의 자체 서버나 온프레미스 환경에서도 높은 보안성과 저비용을 유지하며 강력한 맞춤형 AI 에이전트를 운용할 수 있습니다.