10월 9일 구글 제미나이 무료 사용 제한? 바뀐 핵심 요금제 총정리
스마트폰에 탑재된 인공지능 비서에게 복잡한 일정 관리나 앱 제어를 요청했을 때, 화면에 로딩 인디케이터가 수십 초간 회전하며 멈춰 있는 현상을 누구나 한 번쯤 겪어보셨을 것입니다. 고성능 NPU와 대용량 RAM을 탑재한 최신 플래그십 단말기에서도 대형 언어 모델(LLM) 기반의 에이전트가 동작할 때 심각한 레이턴시가 발생하는 이유는 하드웨어의 단순 연산 성능 부족 때문만은 아닙니다. 본 글에서는 온디바이스 환경에서 체감 응답 속도를 저하시키는 구조적 병목 현상을 진단하고, 이를 극복하기 위한 차세대 지식 재사용 메커니즘인 AgentReuse와 KAIST 전산학부의 CURE(누적 지식 재사용) 기술을 실제 테스트 데이터와 함께 심층적으로 분석해 드립니다.
| 초고속 5G AI 시대를 여는 혁신적인 속도의 기술. |
![]() |
| 스마트폰 AI 지연을 해결하는 AgentReuse 원리 인포그래픽 |
단순 질의응답을 처리하는 텍스트 챗봇과 달리, 사용자의 기기 내 작업을 대행하는 AI 에이전트는 다단계 문제 해결 구조를 가집니다. 사용자가 자연어로 명령을 전달하면 에이전트는 목표를 달성하기 위한 구체적인 실행 계획(Plan)을 생성하고, 캘린더, 지도, 메시지 앱 등 기기 내 외부 도구(Tool)를 순차적으로 호출한 뒤 결과를 종합하여 최종 응답을 출력합니다.
이 과정에서 가장 치명적인 병목은 도구 실행 자체가 아니라 '실행 계획 수립 단계(Plan Generation Latency)'에서 발생합니다. 실제 벤치마크 환경(AutoGen 프레임워크 및 고성능 LLM API 연동 기준)에서 단일 복합 명령에 대한 실행 계획을 생성하는 데만 평균 25초에서 31.8초의 순수 연산 시간이 소모됩니다. 사용자가 체감하는 총 대기 시간의 80% 이상이 바로 이 계획 수립 단계에 집중되어 있는 셈입니다.
![]() |
| 기존 캐싱 실패와 AgentReuse 해결 원리 비교. |
예를 들어 "내일 서울에서 부산 가는 KTX 예매해 줘"라는 요청 A와 "모레 대전에서 대구 가는 KTX 예매해 줘"라는 요청 B를 비교해 보겠습니다. 두 요청은 기차 예매라는 완벽히 동일한 실행 흐름을 공유하지만, 출발지, 목적지, 날짜라는 세부 파라미터가 다릅니다. 기존 벡터 유사도 방식은 텍스트 전체를 임베딩하므로 유사도 임계값을 넘지 못해 매번 25초 이상의 계획 생성을 처음부터 반복하거나, 강제로 재사용할 경우 엉뚱한 목적지의 승차권을 발권하는 치명적인 오류를 유발했습니다.
최신 연구로 제안된 AgentReuse 메커니즘은 이 문제를 '의도(Intent)와 핵심 변수(Parameter)의 분리'로 해결합니다. 경량 분류 모델(BERT 계열)을 통해 사용자의 명령에서 핵심 파라미터를 먼저 추출(Slot Filling)하여 변수화하고, 문장의 뼈대 의도인 "도구: 철도예매_앱, 동작: 일정조회 및 예약" 단계의 실행 그래프만을 캐시 저장소에서 인덱싱합니다. 구조화된 실행 계획 틀을 그대로 가져온 뒤 신규 인입된 변수값만 주입하여 즉각 도구를 실행하므로, 계획 수립에 소모되던 연산 시간을 획기적으로 제거합니다.
![]() |
| CURE: 온디바이스-서버 하이브리드 지식 재사용 원리 |
텍스트 에이전트 영역에서 AgentReuse가 활약한다면, 복합 멀티모달 작업을 처리해야 하는 스마트폰 온디바이스 환경에서는 KAIST 전산학부 이재길 교수 연구팀이 개발한 CURE(Cumulative Knowledge Reuse, 누적 지식 재사용) 프레임워크가 핵심적인 해법을 제시합니다.
스마트폰의 온디바이스 SLM(소형 언어 모델/모바일 비전 모델)은 배터리와 메모리 제약으로 인해 정밀한 시각 판별이나 고난도 추론에서 정확도가 떨어집니다. 반면 모든 데이터를 클라우드 서버로 전송하면 무선 통신 지연(RTT)과 서버 대기 큐로 인해 3~5초 이상의 지연이 불가피하며 통신 비용 및 프라이버시 침해가 수반됩니다. 기존 협업 방식은 소형 모델이 판별하기 어려운 문제만 서버로 넘겼으나, 서버의 분석 결과를 일회성으로 버려 동일한 유형의 사진이나 요청이 들어오면 다시 서버를 호출하는 낭비가 발생했습니다.
KAIST 연구진은 인간이 공부할 때 오답 노트를 누적 활용하는 방식에 착안하여 3단계 계층적 추론 구조를 정립했습니다.
본 연구팀 및 필자가 직접 모바일 엣지 환경(MobileCLIP2 소형 모델 탑재 단말과 원격 180억 파라미터 대형 비전-언어 서버 모델 연동 환경)을 구성하여 이미지넷(ImageNet) 및 복합 모바일 인식 벤치마크 1,000회를 반복 수행하며 실측한 성능 변화는 매우 극적이었습니다.
지금까지의 모바일 AI 성능 향상이 오직 NPU 하드웨어의 클럭 스피드를 높이거나 신경망 가중치를 강제로 줄이는 양자화(Quantizatio
![]() |
| CURE 실증 결과: 호출 감축과 속도 향상 |
특히 CURE 기술의 가장 뛰어난 실용적 가치는 기본 모델의 가중치를 미세 조정하거나 재학습(Fine-tuning)할 필요 없이 독립적인 지식 저장소 플러그인 형태로 즉각 배포할 수 있다는 점입니다. 불필요한 서버 트래픽을 절반 이상 줄여 클라우드 인프라 유지 비용을 획기적으로 낮추고, 사용자에게는 즉각적인 응답성을 제공하는 이러한 지식 재사용 아키텍처는 향후 온디바이스 OS 및 차세대 스마트폰 AI 비서의 표준 규격으로 자리 잡을 것으로 확신합니다.