AWS, 코딩 에이전트에 ‘추론 최적화 스킬’…말로 요구하면 SageMaker 벤치마크 코드를 만든다
AWS가 10월 5일 Agent Toolkit for AWS에 `aws-ai-ml` 스킬을 공개했습니다. Kiro·Claude Code·Codex 등 MCP를 지원하는 코딩 에이전트가 사용자의 지연시간·처리량·비용 요구를 묻고, SageMaker Python SDK v3 기반의 실행 가능한 벤치마크·추천 작업 코드를 작성하는 도구입니다. 배포를 자동으로 맡기는 버튼이 아니라 어떤 인스턴스와 서빙 구성을 왜 시험할지 코드로 드러내는 방식이라는 점이 핵심입니다.

‘어떤 GPU가 맞나’를 자연어 요구에서 시작
생성형 AI 모델을 운영할 때 가장 어려운 질문은 모델을 띄우는 법보다 어느 인스턴스와 서빙 컨테이너가 목표를 만족하는지입니다. 같은 모델도 입력 길이, 동시 요청 수, 첫 토큰 지연, 토큰당 지연에 따라 적합한 구성이 달라집니다. AWS가 공개한 `aws-ai-ml` 스킬은 개발자가 ‘이 모델을 일정 비용 안에서 P90 지연 목표로 비교해 달라’고 설명하면 필요한 확인 질문을 하고 시험 계획을 코드로 바꿉니다.
스킬은 Agent Toolkit for AWS를 통해 설치하며 Kiro, Claude Code, Codex처럼 MCP와 스킬을 다루는 에이전트에서 쓸 수 있습니다. AWS는 로컬 환경뿐 아니라 SageMaker Studio의 비공개 JupyterLab 공간용 사전 구성 이미지도 제공합니다. 중요한 변화는 클라우드 콘솔의 수많은 선택지를 대화형 계획과 검토 가능한 코드 사이에 놓았다는 점입니다.
벤치마크·추천·비교를 한 흐름으로 묶는다
공식 설명에 따르면 스킬은 기존 엔드포인트를 벤치마크하고, 배포 구성을 추천하며, 여러 성능 실행을 비교하고, Hugging Face 모델을 평가용으로 준비할 수 있습니다. 결과물은 SageMaker Python SDK v3 코드입니다. 사용자는 코드를 읽고 인스턴스 후보, 요청 샘플, 반복 횟수와 비용 한도를 수정한 뒤 실행할 수 있습니다.
SageMaker Inference Recommender가 제공해 온 모델·인스턴스 추천과 부하 시험을 코딩 에이전트의 작업 단위로 포장한 셈입니다. 기존에는 문서에서 API를 찾아 작업 정의를 만들고 결과 지표를 나란히 놓아야 했습니다. 새 스킬은 이 연결 작업을 줄이지만, 최종 판단 근거는 여전히 측정값입니다. 말로 ‘가장 싸게’라고 요청해도 서비스 수준과 품질 조건을 숫자로 정하지 않으면 좋은 추천이 될 수 없습니다.
자동 배포가 아니라 ‘보이는 자동화’
AWS는 모든 단계가 실시간으로 보이고, 사용자가 질문하고 고칠 수 있는 코드로 표현된다고 강조합니다. 스킬 자체가 별도 IAM 권한을 얻는 것도 아닙니다. 생성된 코드는 사용자의 AWS 자격 증명 아래에서 SageMaker API를 호출합니다. 엔드포인트 생성과 추천 작업 권한이 없다면 실행되지 않고, 권한이 있다면 발생한 컴퓨팅 비용도 그 계정에 청구됩니다.
이 경계는 에이전트 운영에서 중요합니다. 자연어 인터페이스가 쉬워질수록 고가 인스턴스를 여러 대 띄우거나 민감한 모델 아티팩트를 다른 리전에 복제할 위험도 커집니다. 저장소와 생성 코드를 검토하고, 최소 권한 역할·예산 알림·태그·자동 정리 시간을 함께 두어야 합니다. ‘코드를 만들어 줬다’와 ‘운영 승인을 받았다’는 별개의 단계입니다.
개발팀이 확인할 실제 지표
비교표에는 평균 지연 하나만 두면 안 됩니다. 첫 토큰까지의 시간, 토큰 사이 지연, P50·P90·P99 요청 지연, 초당 처리량, 요청당 비용을 함께 봐야 합니다. 짧은 데모 프롬프트로 얻은 결과는 긴 시스템 프롬프트, 도구 호출, 스트리밍 응답이 섞인 실제 서비스와 다를 수 있습니다. 콜드 스타트와 오토스케일이 피크 시간에 어떤 꼬리를 만드는지도 별도 시나리오로 시험해야 합니다.
추천 작업은 후보를 줄이는 장치이지 품질 평가를 대체하지 않습니다. 양자화나 다른 서빙 엔진이 더 빠르더라도 답변 품질과 함수 호출 정확도가 떨어질 수 있습니다. 같은 평가 데이터로 모델 품질을 고정한 뒤 성능과 비용을 비교해야 합니다. 운영팀은 생성된 스크립트를 버전 관리해 나중에 모델·드라이버·컨테이너가 바뀌었을 때 같은 시험을 재현할 수 있어야 합니다.
에이전트 스킬의 가치는 지식보다 절차에 있다
`aws-ai-ml`이 보여 주는 방향은 클라우드 지식을 챗봇 답변으로만 제공하는 데서 한 단계 나아갑니다. 좋은 스킬은 문서 요약이 아니라 확인 질문, 코드 생성, 측정, 비교, 정리라는 절차를 반복 가능하게 만듭니다. 팀 내부의 배포 기준과 승인 규칙을 이 흐름에 더하면 숙련자의 체크리스트를 여러 개발자가 공유할 수 있습니다.
다만 새 스킬의 효과를 증명하려면 독립적인 전후 비교가 필요합니다. 구성 탐색 시간과 실수율이 얼마나 줄었는지, 추천이 실제 부하에서 유지되는지, 생성 코드가 SDK 업데이트 뒤에도 재현되는지를 봐야 합니다. 이번 발표는 추론 최적화를 ‘대화 가능한 작업’으로 만든 출발점이며, 비용 절감 수치 자체를 보장한 발표는 아닙니다.
기사가 마음에 드셨다면 하트를 눌러주세요.
기사 읽고, 잠깐 게임 한 판 어떠세요?

플레이 실력에 맞춰 난이도가 달라지는 15×15 오목
미니게임 고르기 ▶