AI 에이전트가 바꾸는 연산 수요


생성형 인공지능(AI) 경쟁이 확산되면서 그동안 AI 데이터센터 투자의 중심에는 그래픽처리장치(GPU)가 자리해 왔다. GPU는 수많은 계산을 동시에 수행하는 병렬연산에 강해 대규모 언어모델의 학습과 추론에 필수적인 장치로 평가된다. 이에 따라 주요 기술기업들은 더 많은 GPU를 확보하고 이를 수용할 데이터센터를 확충하는 데 대규모 투자를 이어왔다.


그러나 AI가 질문에 답하는 챗봇에서 사용자를 대신해 실제 업무를 수행하는 ‘AI 에이전트’로 진화하면서 데이터센터의 연산 수요에도 변화가 나타나고 있다. AI 에이전트는 사용자가 원하는 목표를 달성하기 위한 계획을 세우고 웹과 사내 문서를 검색하며 외부 소프트웨어와 응용프로그램 인터페이스(API)를 호출한다. 필요한 경우 코드를 작성 및 실행하고 그 결과를 검토해 작업을 다시 수행하기도 한다.


이 가운데 언어 모델의 추론과 답변 생성은 주로 GPU가 담당하지만 검색 결과 처리, 코드 실행, 파일 관리, 도구 호출 및 여러 작업 간 조율에는 중앙처리장치(CPU)가 폭넓게 사용된다. 기존 챗봇형 AI가 GPU 중심의 대규모 연산에 집중했다면 AI 에이전트는 GPU 밖에서 처리되는 범용 작업을 크게 늘리는 구조이다. 이에 따라 CPU는 GPU를 보조하는 장치를 넘어 AI 에이전트의 실제 작업환경을 운영하는 핵심 구성요소로 다시 주목받고 있다.


이러한 변화는 AI 데이터센터가 GPU 중심의 구조에서 CPU, GPU, 네트워크 처리장치(DPU), 메모리와 스토리지를 함께 활용하는 이기종 컴퓨팅 구조로 전환되는 계기가 되고 있다. AMD, 엔비디아(NVIDIA), 퀄컴(Qualcomm), 암(Arm) 등 주요 반도체 기업도 AI 에이전트에 최적화된 서버용 CPU와 통합 플랫폼을 잇달아 선보이고 있다.


GPU 8개에 CPU 1개는 옛말? 달라지는 AI 서버 구성


AI 에이전트의 확산은 데이터센터에서 CPU와 GPU를 배치하는 방식에도 변화를 가져올 것으로 예상된다. 기존 AI 학습 서버는 대규모 병렬연산을 중심으로 설계돼 소수의 CPU가 여러 개의 GPU를 지원하는 구성이 일반적이었다. 그러나 AI 에이전트 환경에서는 언어모델의 추론뿐 아니라 코드 실행, 데이터 검색, 외부 프로그램 연결 등 범용 연산이 동시에 증가하면서 GPU 수만을 기준으로 서버 용량을 계획하기 어려워지고 있다.


AMD는 기존 챗봇형 AI 환경에서 CPU와 GPU의 구성비가 약 1대 4~8 수준이었다면 AI 에이전트 환경에서는 1대 1 수준으로 이동하고 일부 작업에서는 CPU 비중이 GPU보다 높아질 수 있다고 설명했다. 이는 GPU 수요가 줄어든다는 의미가 아니라, 동일한 수의 GPU를 효율적으로 활용하기 위해 필요한 CPU 자원이 이전보다 증가한다는 의미이다.


반도체 기업인 Arm도 AI 에이전트 확산에 따라 데이터센터의 CPU 코어 수요가 크게 늘어날 것으로 전망했다. 시장조사기관 트렌드포스(TrendForce)가 인용한 Arm의 전망에 따르면 기존 AI 데이터센터에는 전력 1GW당 약 3,000만 개의 CPU 코어가 필요했지만 AI 에이전트 시대에는 약 1억 2,000만 개로 네 배 늘어날 수 있다. CPU와 GPU의 구성비도 향후 약 1대 1~2 수준으로 변화할 가능성이 제기됐다.


다만 1대 1이라는 비율을 모든 AI 데이터센터에 적용되는 새로운 표준으로 해석하기는 어렵다. 이미지, 영상 생성이나 초거대 언어모델 학습처럼 대규모 병렬연산이 중요한 작업은 여전히 GPU 비중이 높을 수 있다. 반면 코딩, 데이터 검색, 업무 소프트웨어 연계 및 시뮬레이션 비중이 높은 AI 에이전트는 상대적으로 많은 CPU 자원을 필요로 한다.


또한 업체마다 CPU와 GPU의 구성비를 산정하는 기준은 다르다. 제품별로 CPU의 코어 수와 성능이 다르고, 일부 전망은 물리적 칩 개수가 아닌 CPU 코어 수나 데이터센터 전력용량을 기준으로 한다. 따라서 업체가 제시한 비율은 절대적인 기준이라기보다 AI 워크로드의 중심이 GPU 단일 장치에서 CPU를 포함한 전체 시스템으로 확장되는 흐름을 보여주는 지표로 이해할 필요가 있다.


반도체 기업, AI 에이전트용 CPU 경쟁 본격화


CPU 역할 확대에 대응해 주요 반도체 기업은 GPU와 CPU를 함께 최적화하거나 새로운 데이터센터용 CPU를 선보이고 있다. 기업별 전략은 다르지만 GPU의 개별 연산 성능뿐 아니라 CPU와 메모리, 네트워크를 결합한 전체 시스템의 처리효율을 높이는 데 초점을 맞추고 있다.


엔비디아는 차세대 베라 루빈(Vera Rubin) 플랫폼에서 자체 설계한 베라 CPU와 루빈 GPU를 고속 인터커넥트로 연결했다. 베라 CPU는 AI 에이전트가 생성한 코드의 컴파일과 실행, 파이썬 도구 사용, 데이터 처리 등 GPU 외부에서 발생하는 작업을 처리하도록 설계됐다. 엔비디아는 자체 벤치마크에서 베라 CPU가 코드 컴파일, 파이썬 도구 실행 및 코드 분석 등 ‘에이전트 샌드박스’ 작업에서 주요 x86 기반 CPU보다 최대 1.8배 높은 성능을 보였다고 설명했다. 또한, 엔비디아는 CPU와 GPU, 메모리, 네트워크 및 소프트웨어를 함께 최적화한 베라 루빈 NVL72가 이전 세대 플랫폼인 GB200 NVL72보다 동일한 전력용량에서 최대 10배 많은 토큰을 처리할 수 있다고 밝혔다.


<엔비디아 베라 루빈 NVL72와 GB200 NVL72의 전력당 토큰 처리량 비교>

external_image

*주: Kimi-K2-Thinking 모델을 이용해 입력 토큰 3만 2,000개, 출력 토큰 8,000개 조건에서 측정한 초당·메가와트당 토큰 처리량

[자료: 엔비디아]


AMD는 에픽(EPYC) CPU와 인스팅트(Instinct) GPU를 결합한 시스템을 통해 에이전트형 AI 수요에 대응하고 있다. GPU가 언어모델의 추론을 담당하는 동안 CPU는 데이터 준비, 가상환경 운영, 코드 실행 및 외부 도구 연결을 처리하는 방식이다. AMD는 에이전트형 AI에서는 CPU를 단순히 GPU를 지원하는 호스트 장치로 보기보다 별도의 연산 계층으로 설계해야 한다고 강조한다.


퀄컴은 2026년 6월 데이터센터용 드래곤플라이(Dragonfly) 제품군을 공개하며 서버용 CPU 시장에 진출했다. 드래곤플라이 제품군은 CPU, AI 추론 가속기, 고속 연결장치 및 맞춤형 반도체를 하나의 데이터센터 플랫폼으로 구성하는 데 초점을 맞췄다. 퀄컴은 모바일 반도체 분야에서 축적한 저전력 설계 경험을 활용해 에이전트당 전력소비와 운영비용을 낮추는 전략을 내세우고 있다.


Arm도 2026년 에이전트형 AI를 겨냥한 데이터센터 CPU를 공개하며 기존의 설계자산 제공 중심 사업에서 완제품 공급으로 영역을 넓히고 있다. 이와 별도로 아마존웹서비스(AWS)의 그래비톤(Graviton), 구글의 액시온(Axion), 마이크로소프트의 코발트(Cobalt) 등 미국 클라우드 기업들도 Arm 아키텍처를 기반으로 자체 서버용 CPU를 개발하고 있다. 이는 AI 인프라 확대가 전통적인 x86 서버용 CPU뿐 아니라 Arm 기반 데이터센터 CPU 시장의 성장으로 이어지고 있음을 보여준다.


<주요 기업의 데이터센터용 CPU 및 AI 플랫폼 전략>

연번

기업

주요 제품·플랫폼

주요 전략

1

엔비디아

Vera CPU·Rubin GPU

CPU와 GPU의 고속 연결 및 통합

2

AMD

EPYC CPU·Instinct GPU

CPU·GPU·DPU를 결합한 전체 시스템 구축

3

퀄컴

Dragonfly C1000

전력효율 중심의 데이터센터 CPU 진출

4

Arm

AGI CPU

에이전트형 AI용 CPU 직접 공급

5

AWS

Graviton

자체 클라우드 환경에 최적화

6

구글

Axion

구글 클라우드용 Arm 기반 CPU

7

마이크로소프트

Cobalt

자사 클라우드 서비스에 최적화된 서버 CPU 확대

[자료: 각 사 발표자료를 바탕으로 KOTRA 시카고무역관 정리]


AI 에이전트 확산에 서버용 CPU 경쟁 본격화


AI 에이전트 확산에 따른 변화는 CPU 시장에만 한정되지 않는다. CPU에서 실행되는 프로그램과 처리되는 데이터가 증가하면 서버용 메모리, 저장장치 및 네트워크 장비의 수요도 함께 늘어날 수 있다. 이에 따라 AI 데이터센터의 부품 수요가 GPU와 고대역폭 메모리(HBM)에서 일반 서버 인프라 전반으로 확대될 가능성이 제기된다.


CPU 기반 서버는 처리 중인 데이터와 프로그램을 임시로 저장하는 DDR 계열 메모리를 주로 사용한다. AI 에이전트가 여러 프로그램을 동시에 실행하고 대량의 검색 결과와 업무 데이터를 처리할수록 CPU가 한 번에 활용할 수 있는 메모리의 용량과 데이터 전송속도도 중요해진다. 이에 따라 기존 세대보다 속도와 전력효율을 높인 서버용 DDR5를 비롯해 저전력·대용량 메모리 모듈, 여러 서버 장치가 메모리를 공유하거나 확장할 수 있도록 지원하는 컴퓨트 익스프레스 링크(Compute Express Link, CXL) 기반 장치에 대한 관심도 높아질 것으로 예상된다.


기업용 솔리드스테이트드라이브(SSD)와 스토리지의 역할도 확대될 수 있다. AI 에이전트는 사내 문서와 데이터베이스에 접근하고, 작업 과정과 실행 결과를 저장하며, 이전 업무내용을 장기적으로 활용해야 한다. 모든 정보를 고가의 고대역폭 메모리에 보관할 수 없기 때문에 사용빈도와 처리속도에 따라 데이터를 서버용 메모리와 SSD, 외부 스토리지에 나눠 저장하는 구조가 중요해지고 있다. 또한, 네트워크 관련 부품 수요도 증가할 가능성이 있다. AI 에이전트가 외부 프로그램과 데이터베이스를 반복적으로 호출하고 여러 서버와 정보를 교환하면 데이터센터 내부와 외부의 데이터 이동량이 늘어난다. 이에 따라 데이터처리장치(DPU), 스마트 네트워크 인터페이스 카드(SmartNIC), 네트워크 스위치, 광트랜시버 및 고속 케이블 등 연결장치 성능의 중요성이 커지고 있다.


결국 AI 인프라의 경쟁력은 GPU의 연산성능만으로 결정되지 않는다. CPU가 작업을 충분히 빠르게 처리하지 못하거나 메모리와 스토리지에서 데이터 공급이 지연되면 고성능 GPU도 대기시간이 늘어날 수 있다. AI 에이전트 확산은 데이터센터 설계의 초점을 개별 반도체의 성능에서 여러 장치 사이의 균형과 연결효율로 이동시키고 있다.


시사점


AI 에이전트의 확산은 GPU를 대체하기보다 GPU 밖에서 수행되는 범용 작업을 늘리며 서버용 CPU 시장에 새로운 성장동력을 제공하고 있다. 한 반도체 제조업체 관계자는 KOTRA 시카고무역관과의 인터뷰에서 “필요한 반도체 구성은 AI 서비스에서 어떤 기능을 강화하려는지에 따라 달라진다”며 “검색, 외부 프로그램 호출, 코드 실행과 작업 조율 능력을 높이려면 CPU가 중요하고 대규모 언어모델의 학습·추론 속도와 동시 요청 처리량을 높이려면 GPU 등 AI 가속기의 역할이 여전히 중요하다”고 설명했다.


이에 따라 관련 기업은 고객이 운영하는 AI 서비스의 작업 특성을 먼저 파악할 필요가 있다. 이미지·영상 생성과 대규모 모델 학습에는 GPU 의존도가 높은 반면 코딩과 검색, 기업 업무 자동화처럼 외부 도구 사용이 많은 서비스에는 상대적으로 많은 CPU 자원이 요구될 수 있다. 공급 제품이 적용될 CPU·GPU 플랫폼과의 호환성 및 인증요건을 사전에 확인하는 것도 중요하다.


AI 인프라 수요의 확대는 한국 기업에 HBM 이외의 새로운 기회를 제공할 수 있다. CPU 활용과 데이터 이동이 증가하면 서버용 DDR5, 기업용 SSD, CXL 기반 메모리 확장장치뿐 아니라 패키징 기판과 고속 데이터 전송 부품의 수요도 함께 늘어날 수 있기 때문이다. 이들 부품은 개별 성능뿐 아니라 전력효율, 장치 간 연결속도 및 주요 서버 플랫폼과의 호환성이 경쟁력을 좌우할 것으로 예상된다.


향후 AI 데이터센터 시장에서는 특정 프로세서의 성능이나 보유량보다 CPU, GPU, 메모리, 저장장치와 네트워크를 작업 특성에 맞게 구성하는 역량이 더욱 중요해질 전망이다. 관련 우리 기업도 AI 공급망 참여 범위를 고대역폭 메모리에서 서버용 메모리와 저장장치, 기판 및 연결부품 등으로 넓히고 주요 반도체·클라우드 기업의 플랫폼 변화에 맞춘 제품 개발과 인증 전략을 마련할 필요가 있다.



자료: 엔비디아, AMD, 퀄컴, Arm, AWS, 구글, 마이크로소프트, KOTRA 시카고무역관 자료 종합


원문 보기