AI · DeepSeek · Huawei · TileLang

DeepSeek·Huawei, Ascend 950 개발도구 공개…‘CUDA 장벽’을 소프트웨어로 낮춘다

DeepSeek가 Huawei와 함께 Ascend 950용 연산·통신 도구를 오픈소스로 공개했습니다. TileLang은 파이썬형 문법에서 NPU 커널을 작성하도록 돕고, DeepGEMM-Ascend는 기존 DeepGEMM API를 유지한 채 BF16·FP8·FP4 행렬연산을 지원합니다. 128개 칩을 묶는 슈퍼노드까지 공동 최적화했지만, CUDA의 방대한 생태계를 대체했다고 말하기에는 독립 벤치마크와 실제 운영 사례가 더 필요합니다.

JJANG-LAB IT TREND
오픈소스 AI 개발도구가 여러 가속기 랙을 하나의 슈퍼노드로 연결하는 편집 이미지
이미지: JJANG-LAB 재사용 가능 자체 제작 이미지

칩 발표 다음 단계는 ‘개발 가능한 생태계’

DeepSeek는 9월 30일 Huawei의 Ascend 플랫폼에 맞춘 프로그래밍 기반기술을 오픈소스로 공개했습니다. Reuters에 따르면 공개 범위에는 연산 커널과 여러 칩 사이의 통신을 다루는 라이브러리가 포함됩니다. Huawei가 새 Ascend 프로세서와 슈퍼노드를 내놓은 뒤, 실제 모델 개발자가 하드웨어를 다룰 수 있게 소프트웨어 층을 채운 발표입니다.

AI 가속기의 경쟁력은 연산 성능표만으로 결정되지 않습니다. 모델 코드가 칩에서 빠르게 실행되도록 바꾸는 컴파일러, 행렬연산 라이브러리, 분산 통신, 디버깅과 프로파일링이 함께 있어야 합니다. NVIDIA CUDA의 강점도 오랫동안 쌓인 이 도구망에 있으므로, DeepSeek와 Huawei는 칩 자체보다 개발 경로의 마찰을 줄이는 문제를 전면에 놓았습니다.

TileLang, 파이썬형 문법과 저수준 최적화 사이

TileLang 공식 저장소는 9월 30일 Ascend 950 백엔드를 추가했다고 밝혔습니다. 네이티브 코드 생성, 자동 스케줄링과 동기화, SIMD·SIMT 혼합 벡터 프로그래밍을 지원하며 GEMM과 FlashAttention 예제도 제공합니다. TVM 기반 컴파일러를 이용해 개발자가 파이썬과 비슷한 문법으로 커널을 쓰면서도 하드웨어별 최적화에 접근하도록 설계됐습니다.

Huawei가 공개한 PTO ISA도 같은 방향입니다. 8개 범주의 120개 이상 가상 명령으로 알고리즘과 TileLang 같은 DSL, 세대가 바뀌는 하드웨어 사이를 잇겠다는 구상입니다. 자동 최적화와 수동 제어를 함께 제공해 쉬운 시작과 세밀한 성능 조정을 양립시키려 하지만, 실제 생산 환경에서는 오류 메시지·문서·컴파일 시간·툴 체인의 안정성이 성능만큼 중요합니다.

DeepGEMM-Ascend는 기존 작업 흐름을 옮긴다

DeepSeek의 DeepGEMM-Ascend 저장소는 기존 DeepGEMM과 API 호환을 유지하면서 Ascend 950에서 BF16, FP8, FP4 GEMM과 MQA logits, MegaMoE 연산을 지원한다고 설명합니다. 복잡한 메모리 배치, 정렬, 주소 계산과 저수준 파라미터를 감추고, 개발자가 다른 플랫폼에서 쓰던 호출 방식을 최대한 유지하도록 한 것이 핵심입니다.

공개 저장소는 CANN 9.20, torch_npu와 Python 3.10 이상을 요구하며 MIT 라이선스로 배포됩니다. Ascend 특유의 희소 데이터 로딩과 코루틴 파이프라이닝도 적용됐습니다. 코드를 내려받을 수 있다는 사실뿐 아니라 빌드 조건과 의존성이 문서화됐다는 점은 재현성을 높이지만, ‘하드웨어 한계에 근접한다’는 자체 설명은 다양한 모델과 입력 크기에서 외부 검증이 필요합니다.

128개 Ascend 950을 하나의 계산 단위로

양사는 Ascend 950 칩 128개를 묶는 슈퍼노드 해법의 계산과 통신도 함께 최적화했습니다. 대형 모델은 칩 한 개의 속도보다 여러 칩이 데이터를 주고받는 과정에서 병목이 생기기 쉽습니다. 커널과 통신 라이브러리를 같은 설계 안에서 조정하면 행렬연산이 끝난 뒤 다음 칩으로 결과를 넘기는 대기시간을 줄일 여지가 있습니다.

다만 128개가 연결됐다는 숫자가 곧바로 선형 성능 향상을 뜻하지는 않습니다. 모델 구조, 메모리 용량, 네트워크 토폴로지, 장애 복구와 작업 스케줄러에 따라 효율이 달라집니다. 단일 데모보다 장시간 학습의 안정성, 동일 전력에서의 처리량, 칩 일부가 실패했을 때의 복구, 여러 팀이 동시에 쓸 때의 자원 격리를 확인해야 합니다.

‘CUDA 대체’는 코드 공개 뒤부터 시작된다

이번 공개는 중국 AI 생태계가 NVIDIA 의존을 낮추려는 구체적인 소프트웨어 움직임입니다. DeepSeek처럼 실제 대형 모델을 만드는 조직이 커널을 공개하면 하드웨어 업체의 예제보다 개발자의 문제에 가까운 출발점을 제공할 수 있습니다. Huawei도 개발자에게 100 NPU-hour 자원을 제공하고 향후 3년간 오픈 생태계에 50억위안을 투자하겠다고 밝혔습니다.

그러나 CUDA에는 수년간 축적된 라이브러리, 프레임워크 통합, 교육 자료와 숙련 인력이 있습니다. 경쟁의 기준은 저장소 개수보다 PyTorch·추론엔진 호환성, 버전 업그레이드 때의 깨짐, 버그 수정 속도, 공개 벤치마크의 재현성입니다. 이번 발표는 대체 완료 선언이 아니라, Ascend를 실제 개발자가 시험하고 비교할 수 있는 공개 출발선에 올려놓았다는 데 의미가 있습니다.

기사가 마음에 드셨다면 하트를 눌러주세요.

JJANG-LAB WEB GAME

기사 읽고, 잠깐 게임 한 판 어떠세요?

AI와 오목 게임 대표 이미지
AI와 오목

플레이 실력에 맞춰 난이도가 달라지는 15×15 오목

미니게임 고르기 ▶