수요일, 인프라 제공업체 테라스위치(Teraswitch)의 라우팅 오류로 인해 네트워크에 스테이킹된 $SOL의 28.83%가 연체 상태가 되면서, 솔라나는 거래 최종성 상실까지 약 2,000만 $SOL 차이로 아슬아슬하게 모면했다.
솔라나는 스테이킹된 $SOL의 33.34% 이상이 오프라인 상태가 되면 거래 확정을 중단합니다. 마리네이드 파이낸스(Marinade Finance)의 계산에 따르면, 이번 사고로 인해 네트워크가 해당 임계치의 86%까지 치솟았습니다.
메인넷은 중단되지 않았습니다. 블록 생성은 계속되었고, 거래도 정상적으로 처리되었습니다. 그러나 이번 사건은 단일 인프라 제공업체의 장애가 네트워크의 상당 부분에 한꺼번에 영향을 미칠 수 있음을 여실히 보여주었습니다.
영향을 받은 검증자들은 약 333 $SOL 상당의 보상을 잃었으나, 이는 에포크 종료 시 검증자 보증금으로 충당될 예정이다.
유럽과 아시아 전역으로 확산된 라우팅 오류
이번 사고는 Teraswitch가 마이애미 시설에서 예상된 속성이 포함되지 않은 기본 경로를 알리면서 시작되었습니다. 이후 암스테르담에 위치한 라우팅 리플렉터가 해당 경로를 유럽과 아시아 전역의 사이트로 배포했습니다.
해당 지역의 에지 라우터들은 이 경로를 자체 로컬 기본 경로로 인식하고 올바른 경로보다 우선적으로 선택했습니다. 코어 인프라는 해당 경로를 유효하지 않은 것으로 거부했고, 그 결과 12개 사이트가 유효한 전달 경로를 잃게 되었습니다.
영향을 받은 지역으로는 런던, 암스테르담, 더블린, 프랑크푸르트, 싱가포르, 도쿄 등이 포함되었습니다. 북미 지역에서는 이와 같은 장애가 발생하지 않았습니다.
테라스위치는 약 10분 만에 문제를 파악했으며, UTC 기준 04:16:15에 트래픽이 정상화되었습니다. 테라스위치가 경로 광고의 원인을 조사하는 동안 마이애미는 해당 공급자의 백본에서 분리된 상태를 유지했습니다.
약 90명의 솔라나(Solana) 검증자가 약 33분 동안 서비스 중단을 겪었습니다.
스테이크 집중으로 인해 영향이 확대됨
마리네이드(Marinade)의 분석에 따르면, AS20326은 1억 1,889만 $SOL을 보유하고 있었으며, 이는 전체 스테이킹된 SOL의 4분의 1 이상에 해당합니다. 이 중 약 94%가 사고 발생 당시 동시에 오프라인 상태가 되었습니다.
또한 Latitude.sh, Limestone, Butterfly Research, Allnodes를 통해 스테이킹된 1,410만 $SOL도 오프라인 상태가 되었습니다. 마리네이드(Marinade)는 현재 확보된 데이터만으로는 이러한 중단 현상이 공통된 의존성 때문인지, 아니면 우연의 일치인지를 판단할 수 없다고 밝혔습니다.
이러한 구분은 호스팅 제공업체만을 기준으로 집중도를 측정할 경우, 동시에 실패할 수 있는 스테이킹 규모를 과소평가할 수 있기 때문에 중요합니다.
또한 마리네이드는 암스테르담, 프랑크푸르트, 도쿄에 걸쳐 8,020만 $SOL을 보유한 59명의 검증자가 동일한 짧은 복구 시간 내에 서비스를 재개한 사실을 확인했습니다. 해당 검증자들은 자동 페일오버를 유발하지 않은 것으로 보이며, 라우팅이 재수렴될 때까지 오프라인 상태를 유지했습니다.
솔라나에서 두 번째로 큰 검증자인 헬리우스(Helius)는 전체 33분 동안 오프라인 상태를 유지했다. 마리네이드가 측정할 수 있었던 74명의 검증자 중, 중복 구성 장치를 통해 문제없이 복구된 검증자는 라인(Laine), 코젠트 크립토(Cogent Crypto, 둘 다 솔 스트래티지스(Sol Strategies)가 운영), 라이온3d(Lion3d) 등 단 3명뿐이었다.
마리네이드는 또한 자사의 위임 프로그램 내 집중 현상도 인정했다. 4개의 ASN이 할당된 스테이크의 3분의 2를 차지하는 반면, AS395201 하나만으로도 36.94%를 차지한다. 이 조직은 ASN 및 데이터 센터별 집중도 한도를 검토하고, 검증자들이 핫스왑 및 자동 장애 조치 시스템을 사용하는지 여부를 공개할 계획이라고 밝혔다.
솔라나비치(Solanabeach)의 최신데이터에 따르면 솔라나의 슈퍼마이너리티 수는 17개로, 네트워크 최종 확정(finality)에 영향을 미칠 만큼 충분한 스테이크를 공동으로 보유한 검증자의 수가 상대적으로 적음을 보여준다.
솔라나 메인넷, 정상 가동 유지
솔라나 재단의 기술 부사장 제이콥 크리치( Jacob Creech)는 스테이킹된 699명의 검증자 중 597명, 즉 약 7명 중 6명이 계속 투표를 진행했다고 강조했습니다. 영향을 받은 검증자들은 40분 이내에 복구되었으며, 솔라나 재단 위임 프로그램(Solana Foundation Delegation Program)에 속한 검증자들은 영향을 받지 않았습니다.
안자(Anza)의 trent.sol은 또 다른 세부 사항을 추가했다. 솔라나의 개발망(Devnet)은 동일한 테라스위치(Teraswitch) 문제 발생 당시 실제로 중단되었으나, 라우팅 문제가 해결되자 자동으로 재개되었다. 개발망과 메인넷은 동일한 소프트웨어를 실행하고 있어, 이는 솔라나의 소프트웨어가 이전 사고에 비해 복원력을 갖추게 되었음을 시사한다.
안자(Anza)의 성능 팀 리더 알레산드로 데치나(Alessandro Decina)는 2년 전이라면 유사한 사건으로 인해 솔라나가 다운되었을 것이라고 말하며, 네트워크의 발전이 소프트웨어 개선의 결과라고 설명했습니다.
2024년 2월의 서비스 중단은 여전히 경고로 남아 있다
솔라나는 2024년 2월에 마지막으로 완전히 중단되었으며, 네트워크가 재가동되기까지 거의 5시간이 걸렸습니다. 그 이후로 솔라나는 네트워크 중단 없이 30개월 연속 100% 가동률을 유지해 왔습니다.
따라서 최근 발생한 사건은 엇갈린 평가를 낳고 있습니다. 솔라나는 스테이크의 거의 29%가 오프라인 상태가 되었음에도 메인넷이 계속 운영될 수 있음을 입증했습니다. 동시에 이번 사건은 인프라의 집중이 네트워크를 최종 확정 임계치에 위험할 정도로 가깝게 만들 수 있음을 보여주었습니다.
솔라나 공동 창립자 그렉 피츠제럴드는 이번 사건을 분산화가 여전히 암호화폐 분야에서 가장 해결하기 어려운 문제 중 하나임을 상기시켜 주는 불편한 경고라고 평가했다.
솔라나를 넘어 확산된 서비스 중단
Pyth 역시 테라스위치(Teraswitch)가 자사의 4개 NATS 노드 중 2개를 호스팅하고 있었기 때문에 서비스 중단을 겪었습니다. 해당 노드에 접속할 수 없게 되자 NATS는 쿼럼을 상실했고, 이에 의존하던 라우터 서비스도 이용 불가능해졌습니다.
Pyth는 이미 인프라 집중도를 낮추기 시작했으며, 인프라 제공업체를 한 곳 더 추가하고 핵심 서비스를 독립적인 장애 도메인에 분산시켜 이 작업을 가속화할 것이라고 밝혔다.
이번 사고로 솔라나 메인넷은 결국 정상 가동을 유지했지만, 인프라 의존성이 어떻게 국지적인 라우팅 장애를 네트워크 전반의 위험으로 순식간에 확대시킬 수 있는지 여실히 보여주었습니다. 만약 연체된 스테이크 비율이 33.34%를 넘어섰다면, 솔라나는 사용자가 $SOL을 어디에 보유하고 있든 상관없이 모든 사용자의 거래 확정을 중단했을 것입니다.
SolanaFloor에서 더 보기
트레이더들이 Fomo의 수수료를 문제 삼으면서 Pump.fun 대 Fomo 갈등이 격화되고 있다
CLARITY가 난항을 겪는 가운데 SEC, 암호화폐 산업 활성화 위한 “대규모 계획” 발표 예정
솔라나, $SOL 소각량 14배 확대 계획
