구글 TPU 8세대, 훈련과 추론 칩을 둘로 나눈 이유

엔비디아가 AI 칩 시장을 사실상 쥐락펴락하는 상황에서, 구글이 조금 다른 방식으로 승부수를 던졌습니다. 이번에 공개된 구글 TPU 8세대는 하나의 칩으로 훈련과 추론을 모두 처리하던 기존 방식을 버리고, 두 가지 작업을 전담하는 칩을 각각 따로 만들었다는 점이 핵심입니다. 왜 굳이 칩을 둘로 나눴는지, 그리고 이 결정이 엔비디아와의 경쟁에서 어떤 의미를 갖는지 정리해 드립니다.

구글 TPU 8세대 칩 공개 장면

구글 TPU가 훈련과 추론 칩을 나눈 배경

구글은 2015년부터 자체 설계한 프로세서로 AI 모델을 돌려왔고, 2018년부터는 클라우드 고객에게도 빌려주기 시작했습니다. 그동안 TPU는 훈련과 추론을 한 칩에서 처리하는 범용 구조를 유지해 왔는데요, 8세대에서 처음으로 이 둘을 분리했습니다.

구글의 아민 바다트 수석 부사장은 블로그를 통해 AI 에이전트 시대가 본격화되면서 훈련과 서빙 각각에 특화된 칩이 필요하다고 판단했다고 설명했습니다. 모델을 학습시키는 작업과 사용자 질문에 빠르게 답하는 작업은 요구 사항이 완전히 다르기 때문에, 하나로 억지로 우겨 넣는 것보다 따로 만드는 게 효율적이라는 계산입니다.

성능은 얼마나 좋아졌나

숫자로 보면 변화 폭이 꽤 큽니다.

  • 훈련 전용 칩: 같은 가격 기준으로 7세대 아이언우드 TPU 대비 2.8배 성능 향상
  • 추론 전용 칩 TPU 8i: 이전 세대 대비 성능 80% 개선
  • 두 칩 모두 올해 안에 출시 예정

흥미로운 점은 구글이 엔비디아 칩과의 직접 성능 비교는 일절 하지 않았다는 것입니다. 자기 세대 간 비교만 공개했는데, 이는 아직 정면 승부보다는 자사 클라우드 생태계 안에서의 입지를 다지는 단계라는 해석이 가능합니다.

Two separate futuristic semiconductor chips side by side on a dark textured circuit board background, one glowing orange for training and one glowing blue for inference, macro photography style, no visible text, 4:3

추론 칩에 SRAM을 넣은 이유는 뭘까

이번 TPU 8i의 또 다른 특징은 SRAM, 즉 정적 랜덤 액세스 메모리를 대량 탑재했다는 점입니다. SRAM은 일반 메모리보다 훨씬 빠르게 데이터를 주고받을 수 있어서, 사용자 질문에 즉각 반응해야 하는 추론 작업에 유리합니다.

재미있는 건 엔비디아도 같은 방향으로 가고 있다는 사실입니다. 엔비디아는 칩 스타트업 그록을 200억 달러에 인수하며 확보한 기술을 바탕으로, SRAM을 대량 활용하는 Groq 3 LPU를 준비 중이라고 밝혔습니다. 최근 상장을 신청한 세레브라스도 SRAM 기반 설계를 쓰고 있고요. 결국 추론 속도 경쟁의 핵심이 메모리 구조로 이동하고 있다는 신호로 읽힙니다.

빅테크들은 왜 자체 AI 칩에 뛰어들까

구글만의 움직임이 아닙니다. 주요 기술 기업들이 너나없이 커스텀 반도체 개발에 뛰어들고 있습니다.

  • 아마존: 2018년 추론용 인페렌시아, 2020년 훈련용 트레이니움 공개. 구글과 같은 분리 전략
  • 마이크로소프트: 지난 1월 2세대 AI 칩 발표
  • 메타: 브로드컴과 협력해 여러 버전의 AI 프로세서 개발 중
  • 애플: 아이폰 자체 칩에 뉴럴 엔진을 수년째 탑재

목적은 명확합니다. 엔비디아 GPU 의존도를 낮추고, 자사 서비스에 딱 맞는 효율을 확보하는 것입니다. 다만 그렇다고 엔비디아를 밀어내는 수준은 아직 아닙니다. 구글 자신도 엔비디아의 큰 고객이거든요.

A conceptual illustration of multiple glowing microchips arranged on a world map style dark blue background with network connection lines, modern tech infographic feel, no visible text, 4:3

TPU 사업의 몸값은 어느 정도일까

시장에서 보는 TPU의 가치도 상당합니다. DA 데이비슨 애널리스트들은 지난 9월 TPU 사업과 구글 딥마인드 AI 조직을 합치면 약 9000억 달러의 가치가 있다고 추산했습니다.

구글은 TPU를 직접 팔기보다 클라우드 서비스를 통해 대여하는 방식을 택했습니다. 엔비디아 GPU의 대안을 찾는 기업들에게 선택지를 제공하면서, 동시에 자사 클라우드로 고객을 묶어두는 전략입니다. 칩 하나가 아니라 생태계 전체를 파는 셈이죠.

Rows of server racks in a modern data center with cool blue and teal lighting, glowing circuit details on hardware, clean professional atmosphere, no visible text, 4:3

앞으로의 경쟁 구도를 어떻게 볼 것인가

정리하면 이번 구글 TPU 8세대의 의미는 세 가지로 압축됩니다.

  1. 범용 칩에서 훈련 전용과 추론 전용으로의 전환
  2. SRAM 중심 설계로 대표되는 추론 속도 경쟁의 본격화
  3. 엔비디아 대항마로서 자체 칩 생태계 확장

엔비디아의 아성이 하루아침에 흔들리진 않겠지만, 훈련과 추론을 분리하는 설계가 업계 표준이 된다면 경쟁의 판 자체가 달라질 수 있습니다. 아마존이 이미 같은 길을 가고 있다는 점도 그 가능성에 무게를 실어줍니다.

마치며

AI 칩 경쟁은 이제 단순한 연산 속도 싸움을 넘어, 어떤 작업에 어떤 구조의 칩이 최적인가를 가리는 단계로 들어섰습니다. 구글 TPU 8세대처럼 훈련과 추론을 분리하는 흐름이 앞으로 어떤 결과를 만들어낼지, 하반기 실제 출시 이후의 벤치마크와 클라우드 도입 사례를 지켜보시면 좋겠습니다. AI 인프라에 관심 있는 분이라면 이번 변화는 꼭 기억해 두세요.

출처: CNBC – Google unveils chips for AI training and inference in latest shot at Nvidia

같이 보면 좋은 글

  • 엔비디아 Groq 3 LPU, SRAM 설계가 바꾸는 추론 시장
  • 아마존 트레이니움과 인페렌시아로 보는 빅테크 자체 칩 전략

함께 보면 좋은 글

​#구글TPU #TPU8세대 #AI칩 #엔비디아 #추론칩 #훈련칩 #SRAM #빅테크 #구글클라우드 #AI반도체

Leave a Comment

error: Content is protected !!