AWS 기술 블로그
Category: Networking & Content Delivery
GS리테일의 전사 AI Gateway 구축 사례 – 1부: 인증·라우팅·계정 자동화 설계
이 블로그는 GS리테일과 AWS의 협업으로 작성되었습니다. 다양한 AI 서비스를 안전하게 활용하기 위한 단일 운영 플랫폼 구축 수백 개 팀 계정의 AI 호출을 하나의 관문에서 인증·비용·쿼터 단위로 통제할 수 있을까요? 생성형 AI는 이제 기업의 업무 환경에 빠르게 자리 잡고 있습니다. 개발자는 코드 작성을 위해 AI를 활용하고, 기획자는 문서 작성과 아이디어 발굴에 AI를 사용하며, 데이터 분석가는 AI를 […]
Amazon EC2 Nitro V6의 Connection Tracking 유휴 타임아웃 변경 대응하기
주말 내내 트래픽이 없던 서비스에서 월요일 아침 첫 요청들만 유독 타임아웃으로 실패합니다. Karpenter가 노드를 교체한 뒤부터는 원인을 알 수 없는 연결 오류가 늘었는데, 부하 테스트를 아무리 돌려도 재현되지 않습니다. 최근 이런 증상을 겪었다면 애플리케이션 코드보다 먼저 확인할 것이 있습니다. 워크로드를 실행 중인 인스턴스 타입의 세대와 Nitro 버전입니다. 2025년 6월부터 출시되고 있는 Nitro V6 기반 인스턴스(m8i, […]
아임웹의 Amazon VPC Lattice 기반 서비스 네트워크 재설계와 비용 최적화 사례
들어가며 아임웹의 서비스 진입 경로는 AWS 계정과 VPC, 클러스터에 걸쳐 확장되어 왔습니다. 그 과정에서 로드밸런서 계층의 한도에 부딪혔는데, 상향 신청으로 해결되는 한도도 있었지만, ECS 서비스당 Target Group 5개 제한처럼 상향 대상이 아닌 것도 섞여 있었습니다. 이를 계기로 마이크로 프론트엔드(Micro-Frontends, MFE) 서빙 경로를 대상으로 서비스 네트워크를 재설계했습니다. 재설계의 골자는 외부 진입점(North-South)과 서비스 간 연결(East-West)의 분리입니다. 기존 […]
AWS MediaTailor SSAI 멀티 CDN 환경의 보안: 토큰 인증, Origin 보안, 서드파티 CDN 제약 대응 – Part2
이 블로그는 2부작 시리즈입니다. Part 1: 멀티 CDN 구성과 동적 전환 (CORS, 캐싱 키 포함) Part 2: 멀티 CDN 환경의 보안 — 토큰 인증, Origin 보안, 서드파티 CDN 제약 대응 (본 글) 1. 도입 [Part 1]에서는 MediaTailor의 CDN prefix와 Configuration Aliases를 활용한 동적 멀티 CDN 구성, 301 Redirect 트래킹 메커니즘, CORS 처리, 캐싱 키 설정을 […]
AWS MediaTailor SSAI 환경에서 멀티 CDN 구성과 동적 전환 – Part1
이 블로그는 2부작 시리즈입니다. – Part 1: 멀티 CDN 구성과 동적 전환 (본 글) – Part 2: 멀티 CDN 환경의 보안 — 토큰 인증, Origin 보안, 서드파티 CDN 제약 대응 1. 도입 OTT 서비스를 운영하는 많은 기업들은 단일 CDN이 아닌 멀티 CDN 전략을 채택하고 있습니다. ISP별 네트워크 품질 차이, CDN 장애 대비, 비용 최적화 등의 […]
AWS Site-to-Site VPN 무중단 운영의 정석 : BGP와 Lifecycle Control로 유지보수 장애 예방하기
들어가며 AWS Site-to-Site VPN은 온프레미스와 AWS VPC를 연결하는 가장 빠르고 간편한 방법입니다. 하지만 운영을 하다 보면 한 번쯤은 이런 경험을 하게 됩니다. “새벽에 갑자기 VPN 터널이 끊기면서 온프레미스-AWS 간 통신이 중단되었습니다. AWS 측에서 예정된 유지보수라고 하는데, 이걸 왜 미리 몰랐을까요?” 실제로 많은 고객이 AWS Site-to-Site VPN 사용 중 터널 유지보수(Tunnel Endpoint Maintenance)로 인한 서비스 장애를 반복적으로 […]
분산 트레이닝 관점에서의 AWS 인터커넥트 기술 소개 – 분산 트레이닝을 위해 알아야 할 GPU 간 고속 통신 기술
대규모 분산 훈련에서 GPU 간 통신 성능은 전체 훈련 효율을 좌우하는 핵심 요소입니다. 수백 대의 GPU가 그래디언트(gradient, 모델이 실수를 고치는 방향 지시서)를 주고받아야 하는 환경에서, 데이터가 GPU 메모리에서 네트워크를 거쳐 원격 노드의 GPU 메모리에 도달하기까지의 경로를 얼마나 효율적으로 설계하느냐가 곧 성능의 차이로 이어집니다. 이번 블로그는 이 시리즈의 마지막 편으로, AWS 인스턴스에서 활용되는 GPU 간 고속 […]
씨미가 4K · 4초 저지연 라이브를 만든 방법 — Amazon IVS와 자체 구축의 하이브리드 설계
본 글은 씨미(ci-me) 라이브 스트리밍 플랫폼이 4K 저지연 라이브 시청 경험을 제공하기 위해 Amazon IVS의 매니지드 환경과 자체 구축 영역을 어떻게 결합했는지에 대한 사례입니다. 또한 1만 명 동시 시청자를 가정한 부하 테스트 과정에서 마주친 기술적 의사결정과 시행착오가 함께 공유됩니다. 1. 배경 씨미(CIME)는 버추얼 스트리머와 게임 스트리머를 위한 라이브 스트리밍 플랫폼입니다. 4K 초고화질, 초저지연 방송 환경, […]
분산 트레이닝 관점에서의 AWS 인터커넥트 기술 소개 – AWS 환경에서 NCCL을 이용한 GPU 간 통신
지난 블로그에서는 ENI(Elastic Network Interface)의 구조와 역할, 그리고 p5.48xlarge와 p6-b300 인스턴스에서 EFA(Elastic Fabric Adapter)를 실제로 어떻게 구성하는지 살펴보았습니다. 이번 블로그에서는 이렇게 구성된 EFA 네트워크 위에서 실제 GPU 간 통신이 어떻게 이루어지는지, 그 핵심에 있는 NCCL(NVIDIA Collective Communications Library) 통신에 대해 소개하고자 합니다. EFA가 고속도로를 깔아주는 인프라라면, NCCL은 그 위에서 수백 대의 GPU가 효율적으로 데이터를 주고받을 […]
하네스 엔지니어링으로 본 Deep Insight – 로컬 개발에서 프로덕션 운영까지의 설계 여정
AI에게 단순히 “잘 해봐”라고 시키는 것과, AI가 스스로 만들고 평가하고 개선하는 Agentic 시스템을 설계하는 건 완전히 다른 결과물을 만들어냅니다. AWS Korea SA Team은 Agentic AI 시스템을 개발할 때 마주하는 다양한 기술적 챌린지들을 직접 풀기 위해 ‘Deep Insight’, 사용자가 업로드한 CSV 데이터와 분석 질문을 받아 최종 DOCX 리포트를 생성하는 프로덕션 Multi-Agent 시스템을 개발했고, 세 편의 블로그 […]








