AI 반도체 경쟁, 이제는 ‘성능’이 아니라 ‘토큰당 비용’이 승부를 가른다
AI 반도체 시장의 핵심 지표가 완전히 바뀌고 있습니다.
예전에는 “누가 더 빠른 GPU를 갖고 있나”가 중요했다면, 이제는 “AI가 답변 1개를 만들 때 들어가는 비용을 얼마나 낮출 수 있나”가 진짜 경쟁력이 되고 있습니다.
특히 생성형 AI가 챗봇을 넘어 AI 에이전트, 코딩 자동화, 기업 업무 자동화로 확장되면서 토큰 사용량이 폭발하고 있습니다.
이 흐름은 엔비디아, AMD, 구글, 아마존, 마이크로소프트, 메타, 오픈AI 같은 빅테크의 데이터센터 투자 전략까지 바꾸고 있습니다.
이번 글에서는 AI 반도체 경쟁이 왜 ‘토큰 경제학’으로 이동했는지, 구글 프로즌 v2, 세레브라스 웨이퍼 스케일 엔진, AMD 헬리오스, 아마존 트레이니엄, 엔비디아 베라 루빈 전략이 각각 어떤 의미를 갖는지 뉴스형으로 정리해보겠습니다.
1. AI 업계의 새 기준, ‘토큰당 비용’이란 무엇인가
최근 AI 업계에서 가장 많이 나오는 표현 중 하나가 “100만 토큰당 비용”입니다.
쉽게 말하면 AI가 글을 읽고, 이해하고, 답변을 생성할 때 들어가는 최소 처리 단위가 토큰입니다.
사람은 문장과 의미를 중심으로 정보를 이해하지만, AI는 텍스트를 더 작은 조각으로 쪼개서 처리합니다.
예를 들어 질문 하나를 입력하고 답변 하나를 받는 과정에서도 수백 개에서 수천 개의 토큰이 사용됩니다.
문제가 되는 지점은 이 토큰 하나하나가 전기, 메모리, 연산 자원, 데이터센터 운영비를 모두 소비한다는 점입니다.
- AI 학습 비용: 모델을 만들 때 한 번 크게 들어가는 일회성 투자 성격이 강합니다.
- AI 추론 비용: 사용자가 AI를 쓸 때마다 계속 발생하는 반복 비용입니다.
- 토큰당 비용: AI 서비스가 장기적으로 수익성을 확보할 수 있는 핵심 지표입니다.
결국 AI 기업 입장에서는 모델 성능만 좋아서는 부족합니다.
좋은 답변을 더 싸게, 더 적은 전력으로, 더 빠르게 만들어야 합니다.
이것이 현재 글로벌 경제전망에서 AI 인프라와 반도체 산업을 가장 중요하게 보는 이유입니다.
2. 왜 갑자기 토큰 사용량이 폭증하고 있을까
가장 큰 이유는 AI 사용 방식이 챗봇에서 AI 에이전트로 바뀌고 있기 때문입니다.
과거 챗봇은 사용자가 한 번 질문하면 AI가 한 번 답변하는 구조였습니다.
이 경우 토큰 사용량은 비교적 제한적이었습니다.
하지만 AI 에이전트는 다릅니다.
AI 에이전트는 사용자의 지시를 받은 뒤 스스로 검색하고, 코드를 작성하고, 파일을 읽고, 외부 도구를 호출하고, 결과를 검토한 뒤 다시 작업을 반복합니다.
- 기존 챗봇: 한 번 질문하고 한 번 답변하는 단순 구조입니다.
- AI 에이전트: 여러 단계의 작업을 반복하며 매번 새로운 토큰을 소비합니다.
- 코딩 에이전트: 작업 하나를 처리하는 데 수십만 개에서 수백만 개의 토큰이 들어갈 수 있습니다.
특히 코딩 자동화 서비스나 기업용 업무 자동화 서비스는 백그라운드에서 장시간 작동하는 경우가 많습니다.
이렇게 되면 사용자는 편리하지만, AI 회사 입장에서는 비용이 빠르게 누적됩니다.
일부 AI 서비스가 주간 사용량 제한을 두거나, 일정 사용량을 넘기면 종량제 과금을 검토하는 이유도 여기에 있습니다.
3. AI 반도체 경쟁의 패러다임 변화: 벤치마크에서 토큰 경제학으로
초기 AI 반도체 경쟁은 비교적 단순했습니다.
더 많은 GPU를 확보하고, 더 큰 모델을 학습시키고, 더 높은 벤치마크 점수를 기록하는 기업이 앞서가는 구조였습니다.
하지만 AI 추론 시대가 열리면서 계산법이 달라졌습니다.
이제 중요한 것은 같은 전력과 같은 비용으로 얼마나 많은 토큰을 처리할 수 있느냐입니다.
이 변화는 데이터센터 투자 방식에도 큰 영향을 줍니다.
기업들은 단순히 GPU를 많이 사는 것보다, 전력 효율, 메모리 구조, 네트워크 병목, 랙 단위 최적화, 소프트웨어 생태계까지 종합적으로 따지기 시작했습니다.
AI 반도체 시장은 이제 ‘칩 성능 경쟁’이 아니라 ‘시스템 전체의 원가 경쟁’으로 넘어가고 있습니다.
4. 토큰당 비용을 낮추는 두 가지 전략
AI 업계가 토큰당 비용을 낮추는 방법은 크게 두 갈래로 나뉩니다.
- 첫 번째는 모델 최적화입니다.
- 두 번째는 하드웨어 최적화입니다.
모델 최적화는 필요한 부분만 작동시키거나, 큰 모델을 작게 압축하거나, 반복되는 프롬프트를 재사용하는 방식입니다.
대표적으로 MoE 구조, 모델 증류, 캐싱, 경량화 모델이 여기에 해당합니다.
중국의 딥시크나 저비용 모델 전략을 내세우는 일부 AI 기업들이 이 방향에서 주목받고 있습니다.
하지만 이번 변화의 핵심은 하드웨어입니다.
AI 사용량이 지금보다 훨씬 더 커질 경우, 모델 최적화만으로는 한계가 있기 때문입니다.
그래서 빅테크와 반도체 업체들은 AI 반도체 자체를 토큰 생산 비용 중심으로 다시 설계하고 있습니다.
5. 구글 프로즌 v2: 범용성을 버리고 제미나이에 최적화하다
구글의 전략은 가장 극단적인 방향에 가깝습니다.
구글은 자사 AI 모델 제미나이에 최적화된 전용 칩으로 알려진 ‘프로즌 v2’ 전략을 추진하고 있습니다.
핵심은 범용성을 포기하는 대신 특정 모델의 토큰 처리 효율을 극단적으로 끌어올리는 것입니다.
기존 구글 TPU는 엔비디아 GPU처럼 여러 AI 모델을 돌릴 수 있는 범용 AI 가속기에 가깝습니다.
하지만 프로즌 v2는 제미나이의 구조와 데이터 처리 방식에 맞춘 전용 칩이라는 점에서 성격이 다릅니다.
원문 기준으로 구글은 전력 단위당 토큰 처리량이 최신 TPU 대비 약 6배에서 10배까지 개선될 수 있다고 기대하고 있습니다.
- TPU: 여러 모델을 돌릴 수 있는 범용 AI 가속기입니다.
- 프로즌 v2: 제미나이에 맞춘 특화형 AI 반도체입니다.
- 전략 방향: 유연성보다 토큰 효율성을 우선합니다.
이 전략은 구글 검색, 유튜브, 클라우드, 워크스페이스 등 다양한 서비스에 제미나이가 결합될수록 더 중요해집니다.
사용자가 늘어날수록 토큰 비용이 폭발하기 때문에, 구글은 처음부터 자사 서비스에 맞는 반도체 구조를 설계하려는 것입니다.
6. 세레브라스 웨이퍼 스케일 엔진: 칩을 연결하지 말고 하나로 크게 만들자
세레브라스는 기존 반도체 설계와 완전히 다른 접근을 합니다.
보통 반도체 회사들은 작은 칩 여러 개를 연결해 대규모 연산을 처리합니다.
반면 세레브라스는 12인치 웨이퍼 한 장을 사실상 하나의 거대한 칩처럼 사용하는 웨이퍼 스케일 엔진을 내세웁니다.
이 방식의 장점은 칩과 칩 사이를 오가는 과정에서 생기는 병목을 줄일 수 있다는 점입니다.
AI 추론에서는 지연 시간이 매우 중요합니다.
특히 사용자가 실시간으로 답변을 기다리는 서비스에서는 초당 처리 가능한 토큰 수가 체감 성능을 좌우합니다.
- 기존 방식: 여러 개의 칩을 연결해 병렬 처리합니다.
- 세레브라스 방식: 웨이퍼 한 장을 거대한 칩처럼 사용합니다.
- 핵심 장점: 칩 간 통신 병목과 지연 시간을 줄입니다.
원문에서는 세레브라스가 프런티어 모델 추론에서 엔비디아 H 시리즈 클러스터 대비 훨씬 높은 초당 토큰 처리 속도를 제시했다고 설명합니다.
다만 이런 수치는 모델 조건, 배치 크기, 네트워크 환경, 소프트웨어 최적화에 따라 달라질 수 있기 때문에 단순 비교보다는 구조적 방향을 보는 것이 중요합니다.
7. AMD 헬리오스: GPU 하나가 아니라 랙 전체로 승부한다
AMD는 엔비디아 의존도를 낮추려는 빅테크들에게 가장 현실적인 대안으로 떠오르고 있습니다.
특히 AMD 헬리오스는 개별 GPU 판매가 아니라 GPU, CPU, 네트워킹을 하나의 랙 시스템으로 통합한 전략이라는 점에서 중요합니다.
이제 경쟁은 칩 하나의 성능이 아니라 랙 단위, 데이터센터 단위의 총소유비용으로 이동하고 있습니다.
마이크로소프트, 메타, 오픈AI, 오라클 등 대형 고객들이 AMD 헬리오스에 관심을 보이는 이유도 여기에 있습니다.
초기 구매 가격이 높더라도 장기적으로 토큰당 운영 비용을 낮출 수 있다면 충분히 투자할 수 있다는 계산입니다.
- AMD 헬리오스: GPU, CPU, 네트워킹을 통합한 랙 단위 AI 시스템입니다.
- 핵심 목표: 총소유비용과 토큰당 비용을 낮추는 것입니다.
- 시장 의미: 엔비디아 독점 구조에 균열을 낼 수 있는 대안입니다.
원문 기준으로 헬리오스 한 대 가격은 엔비디아 경쟁 제품보다 비쌀 수 있지만, 장기 운영비 측면에서는 매력적일 수 있다는 분석이 나옵니다.
AI 인프라 투자는 이제 단순 장비 구매가 아니라 전력비, 냉각비, 소프트웨어 전환 비용, 운영 자동화까지 포함한 장기 투자입니다.
8. 아마존 트레이니엄과 자체 칩 경쟁: 빅테크는 왜 직접 칩을 만들까
아마존은 자체 AI 칩 전략에서 가장 눈에 띄는 기업 중 하나입니다.
AWS는 트레이니엄과 인퍼런시아 계열 칩을 통해 클라우드 고객에게 더 낮은 비용의 AI 연산 옵션을 제공하려고 합니다.
원문에서는 아마존 트레이니엄 3가 100만 토큰 처리 비용 측면에서 엔비디아 GPU 기반 클라우드 대비 더 저렴한 구조를 목표로 한다고 설명합니다.
빅테크가 직접 칩을 만드는 이유는 명확합니다.
엔비디아 GPU를 계속 사서 쓰면 성능은 좋지만, 마진과 공급 제약을 감수해야 합니다.
반대로 자체 칩을 만들면 자사 서비스에 최적화할 수 있고, 장기적으로 클라우드 수익성도 개선할 수 있습니다.
- 아마존: AWS용 자체 AI 칩으로 클라우드 비용 경쟁력을 강화합니다.
- 마이크로소프트: 마이아 계열 칩을 통해 자체 AI 인프라 효율을 높이려 합니다.
- 메타: 자체 AI 가속기와 브로드컴 협력을 통해 추천, 광고, 생성형 AI 워크로드를 최적화합니다.
- 오픈AI: 장기적으로 엔비디아 GPU 대비 추론 비용을 낮추기 위한 자체 칩 전략을 추진하고 있습니다.
이 흐름은 AI 반도체 시장의 구조적 변화를 보여줍니다.
과거에는 반도체 기업이 칩을 만들고 클라우드 기업이 구매하는 구조였다면, 이제는 클라우드 기업이 직접 반도체 설계에 뛰어들고 있습니다.
9. 엔비디아 시대는 끝날까: 아직은 아니다
탈엔비디아 움직임이 강해지고 있지만, 엔비디아 시대가 당장 끝난다고 보기는 어렵습니다.
엔비디아는 여전히 AI 가속기 시장에서 압도적인 점유율을 갖고 있습니다.
무엇보다 엔비디아의 진짜 경쟁력은 GPU 자체만이 아니라 CUDA 소프트웨어 생태계입니다.
AI 개발자와 기업들은 이미 CUDA 기반으로 모델을 학습하고, 최적화하고, 배포하는 워크플로를 구축해왔습니다.
이 소프트웨어 락인 효과는 생각보다 강합니다.
칩 가격이 비싸더라도 기존 코드를 쉽게 돌릴 수 있고, 개발자 생태계가 풍부하며, 문제 해결 자료가 많다는 점은 큰 장점입니다.
- 엔비디아의 강점: GPU 성능, CUDA 생태계, 개발자 기반, 공급망, 시스템 통합 능력입니다.
- 엔비디아의 약점: 높은 가격, 공급 제약, 빅테크의 종속 리스크입니다.
- 경쟁사의 기회: 특정 워크로드에서 더 낮은 토큰당 비용을 제공하는 것입니다.
엔비디아도 이 흐름을 알고 있습니다.
그래서 차세대 랙 시스템인 베라 루빈 NVL72 같은 구조를 통해 칩 단품이 아니라 전체 시스템 단위의 추론 효율을 높이려 하고 있습니다.
결국 엔비디아 역시 ‘더 빠른 GPU’가 아니라 ‘더 싼 토큰’을 향해 움직이고 있습니다.
10. 왜 비싼 칩을 사면서도 토큰 비용이 낮아진다고 말할까
여기서 많은 분들이 헷갈릴 수 있습니다.
“장비 가격이 더 비싼데 어떻게 비용이 낮아진다는 거지?”라는 질문이 자연스럽게 나옵니다.
핵심은 초기 구매 가격과 장기 운영 비용을 구분해야 한다는 점입니다.
AI 데이터센터에서는 서버 가격만 중요한 것이 아닙니다.
전력비, 냉각비, 랙 공간, 네트워크 비용, 장애 대응, 소프트웨어 최적화, 인력 비용까지 모두 포함해야 합니다.
초기 장비 가격이 비싸더라도 같은 전력으로 더 많은 토큰을 처리한다면 장기적으로는 더 저렴할 수 있습니다.
- 초기 비용: 칩과 서버를 구매할 때 들어가는 금액입니다.
- 운영 비용: 전력, 냉각, 유지보수, 소프트웨어 운영 비용입니다.
- 토큰당 비용: 초기 비용과 운영 비용을 모두 반영한 실질 경쟁력입니다.
이 관점에서 보면 빅테크가 엔비디아보다 비싸 보이는 대안 칩이나 시스템을 검토하는 이유가 이해됩니다.
그들은 지금 당장의 장비 가격이 아니라 3년, 5년 동안의 AI 서비스 원가를 보고 있습니다.
11. 다른 뉴스에서 잘 다루지 않는 진짜 핵심 포인트
이번 AI 반도체 경쟁에서 가장 중요한 부분은 “엔비디아를 이기느냐, 못 이기느냐”가 아닙니다.
진짜 핵심은 AI 산업의 수익 모델이 토큰당 비용을 중심으로 재편되고 있다는 점입니다.
- 첫째, AI 기업의 매출보다 비용 구조가 더 중요해지고 있습니다.
- 둘째, AI 에이전트 확산은 토큰 사용량을 기하급수적으로 늘릴 가능성이 큽니다.
- 셋째, 빅테크의 자체 칩 개발은 단순 기술 자랑이 아니라 마진 방어 전략입니다.
- 넷째, 데이터센터 전력 확보 능력이 AI 경쟁력의 핵심 변수로 부상하고 있습니다.
- 다섯째, 앞으로 AI 서비스 가격은 구독료보다 사용량 기반 과금으로 이동할 가능성이 높습니다.
특히 투자 관점에서는 AI 반도체 기업만 보면 부족합니다.
전력 인프라, 냉각 기술, 네트워크 장비, 메모리 반도체, 클라우드 운영 효율까지 함께 봐야 합니다.
AI 산업이 커질수록 반도체만 성장하는 것이 아니라 데이터센터 투자 전체 밸류체인이 움직이기 때문입니다.
12. 앞으로의 관전 포인트: 누가 더 싸게 지능을 뽑아내는가
앞으로 AI 시장의 승자는 단순히 가장 똑똑한 모델을 가진 회사가 아닐 수 있습니다.
가장 똑똑한 모델을 가장 싸게 운영할 수 있는 회사가 승자가 될 가능성이 높습니다.
골드만삭스는 전 세계 AI 토큰 사용량이 장기적으로 현재보다 크게 증가할 것으로 전망하고 있습니다.
만약 AI 에이전트가 기업 업무, 소프트웨어 개발, 고객 응대, 금융 분석, 헬스케어, 제조 자동화에 본격적으로 들어간다면 토큰 수요는 지금과 비교하기 어려울 정도로 커질 수 있습니다.
이 상황에서 기업들은 세 가지 질문에 답해야 합니다.
- 우리 AI 서비스는 토큰당 얼마의 비용이 드는가?
- 사용량이 10배 늘어났을 때도 수익성이 유지되는가?
- 엔비디아 의존도를 낮추면서도 안정적인 AI 인프라를 확보할 수 있는가?
결국 AI 반도체 전쟁은 성능 경쟁에서 원가 경쟁으로 이동하고 있습니다.
그리고 이 변화는 생성형 AI 산업의 수익성, 클라우드 가격 정책, 글로벌 데이터센터 투자, 반도체 공급망, 빅테크 주가 흐름까지 모두 연결될 가능성이 큽니다.
< Summary >
AI 반도체 경쟁의 핵심은 이제 성능이 아니라 토큰당 비용입니다.
AI 에이전트 확산으로 토큰 사용량이 폭증하면서 추론 비용이 AI 기업의 수익성을 좌우하고 있습니다.
구글은 제미나이 최적화 칩으로 범용성을 줄이고 효율을 높이려 합니다.
세레브라스는 웨이퍼 스케일 칩으로 병목을 줄이는 전략을 택했습니다.
AMD는 헬리오스를 통해 랙 단위 총소유비용 경쟁에 뛰어들었습니다.
아마존, 마이크로소프트, 메타, 오픈AI는 자체 AI 칩으로 엔비디아 의존도를 낮추려 하고 있습니다.
하지만 엔비디아는 CUDA 생태계와 차세대 랙 시스템으로 여전히 강력한 지위를 유지하고 있습니다.
앞으로 AI 산업의 승자는 더 빠른 칩을 가진 기업이 아니라, 더 싸게 지능을 생산하는 기업이 될 가능성이 큽니다.



