AI · Palo Alto Networks · Unit 42 · Anthropic · OpenAI

Unit 42, Claude·GPT로 기업망을 계속 공격한다…‘상시 AI 레드팀’ 출시

팔로알토 네트웍스가 기업의 웹 애플리케이션·API·클라우드를 지속적으로 공격 시험하는 ‘Unit 42 Continuous Frontier AI Defense’를 공개했습니다. Claude Mythos 5, GPT-5.6-Cyber와 오픈웨이트 모델을 한 시스템에서 함께 쓰고, AI가 찾은 취약점을 Unit 42 전문가가 실제 악용 가능한 경로인지 검증합니다. 연 1회 침투시험을 상시 점검으로 바꾸려는 서비스지만, 고객은 AI에 부여하는 접근권한과 자동 수정 범위를 엄격히 통제해야 합니다.

JJANG-LAB IT TREND
여러 AI 모델이 웹, API, 클라우드를 점검하고 전문가가 검증하는 Unit 42 상시 보안 구조 도식
이미지: JJANG-LAB 재사용 가능 자체 제작 보안 구조 도식

정기 침투시험을 ‘항상 켜진 공격자’로 바꾼다

팔로알토 네트웍스는 9월 22일 ‘Unit 42 Continuous Frontier AI Defense’를 발표했습니다. 기업의 웹 애플리케이션과 API, 클라우드 인프라가 바뀔 때마다 공격 가능성을 다시 탐색하는 상시형 보안 서비스입니다. 정해진 시점에 사람이 며칠간 살펴보는 침투시험과 달리 새 코드와 설정이 배포된 뒤 생기는 노출을 계속 찾는 것이 목표입니다.

서비스는 단순 취약점 스캐너보다 넓은 범위를 주장합니다. 발견한 오류를 서로 연결해 실제 침입 경로가 되는지 시험하고, 악용 증거와 수정 우선순위를 제공합니다. 보안팀이 수천 건의 경고를 모두 처리하는 대신 실제 피해로 이어질 가능성이 큰 경로부터 보게 하려는 설계입니다.

한 모델이 아니라 Claude·GPT·오픈웨이트를 묶었다

핵심은 다중 모델 구성입니다. 회사 발표와 로이터 보도를 종합하면 Anthropic의 Claude Mythos 5, OpenAI의 GPT-5.6-Cyber, 여러 오픈웨이트 모델을 함께 사용합니다. 모델마다 코드 이해, 공격 경로 추론, 도구 사용에서 강점과 놓치는 부분이 다르다는 전제입니다.

Axios는 내부 시험에서 복잡한 환경의 취약점을 한 모델이 40% 넘게 찾아내지 못했다고 전했습니다. 이 수치는 회사 시험 결과라 독립 재현이 필요하지만, 특정 모델 하나에 보안 판단을 맡기지 않은 이유는 보여 줍니다. 여러 모델의 제안을 합친 뒤 Unit 42의 공격 보안 전문가가 실제 악용 가능한지 검증합니다.

발견에서 코드 수정·가상 패치까지

점검 결과는 취약점 목록에서 끝나지 않습니다. 서비스는 코드 수준 수정안, 설정 변경과 가상 패치 같은 대응책을 제시합니다. 개발팀이 수정 위치를 찾는 시간을 줄이고, 즉시 코드를 바꾸기 어려운 시스템에는 네트워크 계층의 임시 차단책을 우선 적용할 수 있게 하려는 것입니다.

다만 자동 생성된 수정은 새 오류를 만들 수 있습니다. 제안 코드는 별도 브랜치에서 테스트하고, 가상 패치는 정상 트래픽을 막지 않는지 확인해야 합니다. 탐지·검증·수정·재시험을 기록해 누가 어떤 근거로 변경을 승인했는지도 남겨야 합니다.

방어용 AI도 강한 권한이 필요하다는 역설

상시 공격 시험을 하려면 서비스가 코드와 자산 목록, API 구조, 클라우드 설정에 접근해야 합니다. 공격자를 찾는 도구 자체가 민감한 지도를 갖게 되는 셈입니다. 읽기 전용 계정, 짧은 수명의 자격증명, 테스트 시간대와 대상 제한, 결과 데이터의 보관 위치를 계약과 기술 설정 양쪽에서 확인해야 합니다.

운영 환경에서 파괴적 명령을 실행하지 않도록 허용 도구를 좁히고, 자동 수정은 기본적으로 사람 승인을 거치게 해야 합니다. AI 모델 공급자별로 어떤 데이터가 전달되는지, 로그가 학습에 쓰이지 않는지, 모델 교체 시 정책이 유지되는지도 점검 항목입니다.

AI 공격 속도에 맞춘 보안의 새 구매 단위

이 서비스는 전 세계에서 연간 구독으로 제공되며 비용은 선택한 모델과 범위에 따라 달라집니다. 이는 보안 구매 단위가 ‘연 1회 보고서’에서 ‘계속 돌아가는 공격 검증 능력’으로 옮겨 가는 신호입니다. 배포가 잦은 기업일수록 정기 점검 사이의 공백을 줄일 가치가 큽니다.

도입 효과는 발견 건수보다 실제 위험 감소로 평가해야 합니다. 검증된 고위험 경로 수, 수정까지 걸린 시간, 오탐률, 재발률과 서비스가 가진 권한을 함께 측정해야 합니다. AI가 더 많은 경고를 만드는 것이 아니라 사람이 고칠 수 있는 순서로 위험을 좁힐 때 상시 레드팀의 의미가 생깁니다.

기사가 마음에 드셨다면 하트를 눌러주세요.

JJANG-LAB WEB GAME

기사 읽고, 잠깐 게임 한 판 어떠세요?

AI와 오목 게임 대표 이미지
AI와 오목

플레이 실력에 맞춰 난이도가 달라지는 15×15 오목

미니게임 고르기 ▶