d-Matrix ‘랩터’, 엔비디아 NVLink 랙에 합류…AI 추론을 GPU와 나눠 맡는다
AI 반도체 스타트업 d-Matrix가 차세대 추론용 XPU ‘랩터’를 엔비디아 NVLink Fusion·MGX 랙에 통합합니다. GPU가 입력 처리, 랩터가 토큰 생성을 맡는 이기종 구조로 코딩 도우미·음성 에이전트의 지연시간과 비용을 낮추겠다는 구상입니다.

추론 전용 칩이 엔비디아 랙 안으로 들어간다
d-Matrix는 9월 10일 차세대 추론용 XPU 랩터를 엔비디아의 NVLink Fusion과 MGX 랙 규모 설계에 통합한다고 발표했습니다. 다년 제품 로드맵의 첫 단계로, 엔비디아 베라 CPU와 NVLink 스위치, 블루필드-4 DPU, ConnectX-9 네트워크, Spectrum-X 이더넷으로 구성된 참조 구조에 랩터를 연결합니다. 초기 공급 목표는 2027년 4분기입니다.
이번 협력은 엔비디아가 모든 연산을 자체 GPU로 처리하는 방식만 고집하지 않고, 특정 작업에 맞춘 외부 XPU가 같은 랙과 공급망을 쓰게 한다는 점에서 의미가 있습니다. d-Matrix는 AI 연구소·하이퍼스케일러·네오클라우드가 기존 데이터센터 규격을 크게 바꾸지 않고 저지연 추론 자원을 추가할 수 있다고 설명합니다.
프리필은 GPU, 디코드는 XPU: 추론을 둘로 나누는 이유
생성형 AI 추론은 사용자의 긴 입력을 한꺼번에 처리하는 프리필과 답변 토큰을 순서대로 만들어 내는 디코드로 나눌 수 있습니다. 프리필은 병렬 연산량이 크고, 디코드는 매 토큰의 지연시간과 메모리 접근 효율이 중요합니다. d-Matrix는 코딩 도우미에서 GPU가 프리필을, 랩터가 디코드를 맡는 이기종 분리 구성을 대표 사례로 제시했습니다.
두 장치의 장점을 살리려면 중간 상태를 빠르게 넘겨야 합니다. 연결이 느리면 전용 칩에서 얻는 이득이 데이터 이동 시간에 사라집니다. NVLink Fusion은 맞춤 XPU가 엔비디아 랙의 고대역폭·저지연 연결 구조를 쓰게 하고, 아스테라랩스는 랙 전체 데이터 흐름을 위한 맞춤 연결 솔루션을 공동 개발합니다.
랩터의 승부수: DRAM과 SRAM 연산 칩을 수직 적층
랩터는 현재 양산 중인 코르세어의 후속 플랫폼입니다. d-Matrix 설명에 따르면 DRAM 메모리 칩과 연산 기능을 담은 SRAM 칩을 한 패키지에 수직으로 쌓는 ‘2층’ 구조를 사용합니다. 모델 가중치와 중간 데이터를 연산부 가까이에 두어 메모리 벽을 줄이고, 대화형 서비스에서 토큰이 늦게 나오는 문제를 겨냥합니다.
회사는 관련 기술이 100건이 넘는 특허로 뒷받침되고 하이퍼스케일러와 프런티어 AI 연구소에서 평가 중이라고 밝혔습니다. 다만 랩터는 아직 테이프아웃 전이며 목표 시점은 2026년 말입니다. 설계 완료 뒤 제조 수율, 패키징과 소프트웨어 안정화까지 거쳐야 하므로 발표 수치와 상용 시스템의 결과는 구분해 봐야 합니다.
개발자와 운영자에게 달라지는 것
코딩 도우미, 실시간 챗봇, 음성 에이전트는 첫 응답과 토큰 간격이 체감 품질을 좌우합니다. 추론 단계를 서로 다른 장치에 배치할 수 있다면 서비스 수준에 따라 GPU와 XPU 비율을 조정하고, 같은 전력·공간에서 더 많은 동시 사용자를 처리할 가능성이 생깁니다. 랙 규격을 공유하면 냉각·전력·관리 체계를 새로 만드는 부담도 줄일 수 있습니다.
반대로 모델을 두 장치에 나누는 스케줄러, 장애 복구, 관측 도구와 프레임워크 호환성이 복잡해집니다. 모델 구조나 컨텍스트 길이가 바뀌면 어느 단계를 어디에 배치할지도 다시 계산해야 합니다. 하드웨어 연결 표준만으로 운영 비용이 자동으로 낮아지는 것은 아니며, 소프트웨어 도구와 실제 워크로드 벤치마크가 채택을 좌우합니다.
확인해야 할 일정과 경쟁 구도
공식 발표는 랩터의 테이프아웃을 2026년 말, NVLink Fusion·MGX 통합 시스템의 초기 공급을 2027년 4분기로 잡았습니다. 로이터도 이 일정과 아스테라랩스의 참여를 별도로 확인했습니다. 그러나 금융 조건, 고객명, 처리량·전력·총소유비용의 비교 수치는 공개되지 않았습니다.
따라서 이번 소식은 완성 제품의 승리가 아니라 엔비디아 생태계가 맞춤 추론 칩을 흡수하는 방향을 보여 주는 로드맵입니다. 향후에는 랩터 샘플의 실측 성능, GPU와 분리했을 때의 전송 오버헤드, 주요 AI 프레임워크 지원, 2027년 공급 일정이 핵심 확인 항목입니다.
기사가 마음에 드셨다면 하트를 눌러주세요.
기사 읽고, 잠깐 게임 한 판 어떠세요?

플레이 실력에 맞춰 난이도가 달라지는 15×15 오목
미니게임 고르기 ▶