반도체 · Huawei · Ascend · NVIDIA · Atlas SuperPoD

화웨이, Ascend 960 출시 앞당긴다…AI 칩 한계를 ‘100만개 연결’로 돌파

화웨이가 2027년 1분기 학습용 Ascend 960DT, 3분기 추론용 Ascend 960PR을 내놓고 UnifiedBus 기반 대규모 AI 시스템을 확대합니다. 단일 칩의 성능과 생산 제약을 더 많은 프로세서의 고속 연결로 보완하는 전략입니다. 다만 최대 100만개 연결은 시스템 설계 상한이며 실제 고객 배치 성능을 뜻하지는 않습니다.

JJANG-LAB IT TREND
HUAWEI CONNECT 2026 무대에서 AI 컴퓨팅 전략을 발표하는 화웨이 경영진
이미지: Huawei 공식 HUAWEI CONNECT 2026 발표 이미지

2027년, 학습용과 추론용을 나눠 투입

화웨이가 9월 17일 상하이에서 열린 HUAWEI CONNECT 2026에서 차세대 AI 가속기 일정을 공개했습니다. 로이터에 따르면 대규모 모델 학습을 겨냥한 Ascend 960DT는 2027년 1분기, 서비스 단계의 답변 생성과 추천 같은 추론을 맡는 Ascend 960PR은 3분기에 출시될 예정입니다. 당초보다 일정을 앞당긴 로드맵으로, 2028년 Ascend 970과 2029년 Ascend 980까지 매년 새 세대를 내겠다는 계획도 제시했습니다.

여기서 DT와 PR은 같은 칩을 이름만 바꾼 것이 아니라 서로 다른 AI 워크로드에 초점을 둔 제품군입니다. 학습은 방대한 데이터를 장시간 처리하는 처리량과 메모리 연결이 중요하고, 추론은 실제 이용자의 요청을 빠르고 효율적으로 처리해야 합니다. 화웨이가 두 제품의 세부 공정과 가격, 고객 공급량은 아직 공개하지 않았기 때문에 발표 일정이 곧 대량 공급을 보장하는 것은 아닙니다.

핵심은 단일 칩보다 ‘연결’

이번 발표의 중심은 개별 칩의 최고 성능보다 많은 칩을 하나의 컴퓨터처럼 묶는 UnifiedBus입니다. 화웨이는 이 인터커넥트 규격을 적용한 반도체 11종을 개발했고, Atlas SuperPoD와 그보다 큰 슈퍼클러스터에 활용한다고 설명했습니다. 고급 노광장비와 해외 최첨단 칩 접근이 제한된 상황에서, 확보 가능한 칩 수를 늘리고 칩 사이 데이터 이동 병목을 줄여 전체 시스템 성능을 끌어올리려는 방식입니다.

AP가 전한 Atlas 960 SuperPoD도 같은 전략을 보여 줍니다. 수개월 전 공개한 이전 세대보다 학습·추론 능력을 높인 대형 시스템으로, 화웨이는 차세대 960E에 전기 배선 대신 광학 연결을 가까이 배치하는 NPO 기술을 적용할 계획입니다. 다만 칩 수가 늘면 통신 지연과 전력, 냉각, 소프트웨어 조율도 함께 어려워집니다. 숫자가 큰 클러스터가 자동으로 더 효율적인 것은 아닙니다.

‘100만개’는 설계 상한, 실전 배치는 별개

화웨이는 가장 큰 슈퍼클러스터가 최대 100만개의 AI 프로세서를 지원할 수 있다고 밝혔습니다. 이 수치는 하나의 랙이나 한 고객에게 이미 설치된 장비 규모가 아니라 여러 SuperPoD를 더 큰 시스템으로 연결하는 아키텍처의 상한입니다. 실제 성능은 모델 구조, 네트워크 사용률, 장애 처리, 전력 공급과 소프트웨어 최적화에 따라 크게 달라질 수 있습니다.

상용화의 단서는 기존 공급 실적에서 찾을 수 있습니다. 화웨이는 지금까지 1,000대가 넘는 슈퍼노드를 370곳 이상의 고객에게 출하했고, 관련 생태계의 월간 활성 개발자가 5,270명이라고 밝혔습니다. 그러나 고객 명단과 시스템별 칩 수, 독립 벤치마크는 공개하지 않았습니다. 따라서 공급 대수와 최대 연결 규모는 참고 지표로 보고, 출시 뒤 실제 워크로드 결과를 확인해야 합니다.

중국 수요는 생산 능력을 앞섰다

로이터는 중국 내 화웨이 AI 장비 수요가 현재 생산 능력을 웃돌아 해외 확대까지 제약하고 있다고 보도했습니다. 미국의 수출 통제로 엔비디아의 고성능 가속기와 첨단 제조 장비 접근이 제한되면서 중국 AI 개발사들이 현지 대안을 찾은 결과입니다. 수요가 많다는 사실은 시장 기회인 동시에 수율과 메모리, 패키징을 포함한 공급망 병목이 아직 해소되지 않았다는 뜻이기도 합니다.

화웨이가 연결 기술을 강조하는 이유도 여기에 있습니다. 단일 칩의 공정 격차를 단기간에 모두 좁히기 어려우면 시스템 설계와 네트워크로 총연산량을 키울 수 있습니다. 대신 같은 성능을 내는 데 더 많은 칩과 전력이 필요할 수 있으므로 총소유비용, 에너지 효율, 안정적인 대량 생산이 기업 고객의 최종 판단 기준이 됩니다.

다음 승부는 소프트웨어와 검증 데이터

AI 인프라는 칩만 납품해서 완성되지 않습니다. 개발 도구, 모델 프레임워크 호환성, 통신 라이브러리와 장애 복구가 함께 작동해야 수천개의 가속기를 효율적으로 쓸 수 있습니다. 엔비디아가 CUDA 생태계에서 여전히 우위를 가진 만큼, 화웨이는 CANN을 비롯한 소프트웨어 도구와 개발자 지원을 늘려 이전 비용을 낮춰야 합니다.

앞으로 볼 지표는 세 가지입니다. 960DT·960PR의 실제 출하 시점과 물량, 동일 모델 학습에서의 성능·전력 효율, 대규모 UnifiedBus 시스템의 가동률과 장애 데이터입니다. 이번 발표는 중국 AI 반도체 전략이 단일 칩 경쟁을 넘어 시스템 전체 설계로 이동했다는 선언입니다. ‘100만개 연결’이라는 규모보다 그것을 얼마나 안정적이고 경제적으로 운용하느냐가 성패를 가를 전망입니다.

기사가 마음에 드셨다면 하트를 눌러주세요.

JJANG-LAB WEB GAME

기사 읽고, 잠깐 게임 한 판 어떠세요?

AI와 테트리스 게임 대표 이미지
AI와 테트리스

공격을 주고받으며 실시간으로 겨루는 AI 블록 대전

미니게임 고르기 ▶