NVIDIA, 64GB DGX Spark 공개…두 대 연결해 128GB 로컬 AI로
NVIDIA가 DGX Spark의 64GB 통합 메모리 구성을 10월 23일부터 OEM 파트너를 통해 4,999달러부터 판매합니다. GB10 Grace Blackwell, DGX OS와 AI 소프트웨어 스택을 유지하고, 두 대를 200GbE ConnectX-7로 연결하면 Sync Cluster Assistant가 128GB 메모리 풀로 구성합니다. 한 대에서 최대 1,000억 파라미터 모델을 실행한다는 회사 설명은 정밀도·양자화·컨텍스트에 따라 달라지므로 실제 워크로드 벤치마크가 필요합니다.

128GB 아래에 64GB 선택지를 새로 넣었다
NVIDIA는 10월 2일 DGX Spark에 64GB 통합 메모리 구성을 추가한다고 발표했습니다. 판매 시작일은 10월 23일이며 Acer, ASUS, Dell, Gigabyte, HP와 MSI의 참여 제품이 4,999달러부터 나옵니다. NVIDIA가 직접 파는 Founders Edition이 아니라 참여 OEM 전용 구성이라는 점도 공식 제품 페이지에 명시됐습니다.
핵심 플랫폼은 유지됩니다. GB10 Grace Blackwell 슈퍼칩, DGX OS와 CUDA 가속 AI 소프트웨어 스택, ConnectX-7 네트워킹을 한 상자에 묶습니다. 최대 1페타플롭이라는 수치는 FP4 연산 기준의 이론적 AI 성능이므로 일반 FP16 작업이나 실제 모델 응답 속도와 같은 값으로 읽어서는 안 됩니다.
한 대 64GB, 두 대는 200GbE로 128GB
64GB가 부족하면 두 장치를 ConnectX-7 포트와 200GbE 패브릭으로 연결할 수 있습니다. NVIDIA Sync Cluster Assistant가 네트워크 설정과 작업 라우팅을 자동화해 두 시스템의 메모리를 128GB 풀처럼 사용하도록 돕습니다. 한 장치에서 시작한 워크플로를 소프트웨어 환경을 다시 만들지 않고 확장한다는 것이 공급사의 설명입니다.
10월 말에는 Sync Model Launcher도 제공될 예정입니다. 예시로 Qwen3.8 27B를 한 대 또는 클러스터에 내려받아 실행하고, 브라우저의 코딩 도구가 그 모델을 쓰도록 연결합니다. 기본 프레임워크는 llama.cpp, Ollama, vLLM과 LM Studio가 제시됐습니다. 클릭 수가 줄어들어도 모델 라이선스와 실행 옵션 검토까지 자동으로 끝나는 것은 아닙니다.
‘최대 1,000억 파라미터’는 조건부 숫자
NVIDIA 제품 페이지는 64GB 한 대에서 최대 1,000억 파라미터, 128GB 구성에서 최대 2,000억 파라미터 모델을 제시합니다. 하지만 파라미터 수만으로 실행 가능성을 판단할 수 없습니다. 가중치 정밀도와 양자화 방식, 컨텍스트 길이에 따른 KV 캐시, 런타임 버퍼와 운영체제가 같은 메모리를 나눠 씁니다.
예를 들어 낮은 비트로 양자화하면 큰 모델을 넣을 수 있지만 정확도와 도구 호출 안정성이 달라질 수 있습니다. 두 노드에 모델을 분할하면 네트워크 왕복과 동기화 비용도 생깁니다. 따라서 ‘메모리에 들어간다’와 ‘대화형 속도로 안정적으로 서비스한다’는 분리해 측정해야 합니다.
로컬 에이전트의 장점과 운영 비용
소스 코드, 내부 문서와 연구 데이터를 외부 추론 API로 보내지 않고 책상 위에서 처리할 수 있다는 점은 분명한 장점입니다. 장시간 실행하는 코딩·리서치 에이전트를 별도 장치에 두면 업무용 PC의 CPU와 GPU도 덜 점유합니다. 네트워크가 끊겨도 모델과 데이터가 준비돼 있다면 핵심 작업을 이어 갈 수 있습니다.
반면 두 대를 묶으면 장비 가격만 최소 9,998달러가 되고 케이블, 저장장치, 전력과 관리 비용이 더해집니다. 클라우드 사용량이 간헐적인 팀이라면 초기 비용을 회수하기 어려울 수 있습니다. 로컬이라는 이유만으로 안전한 것도 아닙니다. 에이전트 권한, 비밀키 보관, 모델 공급망과 로그 접근 통제는 별도로 설계해야 합니다.
구매 전에는 실제 프롬프트로 재현 가능한 시험을
팀은 후보 모델의 실제 시스템 프롬프트, 평균·최대 컨텍스트, 동시 요청 수를 고정해 한 대와 두 대를 비교해야 합니다. 첫 토큰 지연, 초당 토큰, P95 응답 시간, 전력과 작업당 비용을 함께 기록하면 단순 최대 성능보다 운영 가치를 판단하기 쉽습니다. 양자화별 정확도와 함수 호출 성공률도 같은 평가 세트로 확인해야 합니다.
64GB DGX Spark는 로컬 AI의 진입 가격을 낮췄다기보다 메모리 용량과 확장 방식을 세분화한 제품에 가깝습니다. 성공 여부는 ‘작은 상자에서 큰 모델’이라는 구호보다 Sync가 서로 다른 프레임워크와 모델에서 얼마나 안정적으로 분산 실행을 재현하는지, 그리고 OEM 제품이 예고한 날짜에 실제 공급되는지에 달렸습니다.
기사가 마음에 드셨다면 하트를 눌러주세요.
기사 읽고, 잠깐 게임 한 판 어떠세요?

플레이 실력에 맞춰 난이도가 달라지는 15×15 오목
미니게임 고르기 ▶