ERPC, Solana 네트워크 인프라를 대폭 개선. Rust 고성능 프록시 플랫폼 전면 업그레이드, 공유 RPC·gRPC·Shredstream 전 지역 배포. 무중단 업데이트 달성

ERPC, Solana 네트워크 인프라를 대폭 개선. Rust 고성능 프록시 플랫폼 전면 업그레이드, 공유 RPC·gRPC·Shredstream 전 지역 배포. 무중단 업데이트 달성

ERPC, Solana 네트워크 인프라를 대폭 개선. Rust 고성능 프록시 플랫폼 전면 업그레이드, 공유 RPC·gRPC·Shredstream 전 지역 배포. 무중단 업데이트 달성
ELSOUL LABO B.V. (본사: 네덜란드 암스테르담, 대표이사 CEO: Fumitake Kawasaki)가 운영하는 ERPC와 Validators DAO는 Solana 네트워크 인프라의 대규모 업그레이드를 완료했습니다.
이번 업그레이드는 이미 모든 지역과 ERPC가 제공하는 모든 공유 엔드포인트(Solana RPC, Geyser gRPC, Shredstream)에 적용되었습니다. 연결 시작, TLS 처리, 캐시 제어, HTTP/1.1 및 HTTP/2 전송, 장시간 연결 동작, 관측 가능성과 문제 해결을 위한 메트릭 등 실제 결과에 직접 영향을 미치는 인프라 동작을 통합된 시스템으로 업데이트했습니다.
일상적인 응답성을 기본으로 유지하면서도, 피크 부하 변동성, 지속 운영 중 불안정성, 연결 끊김과 재연결로 촉발되는 연쇄 현상처럼 결과가 악화되기 쉬운 상황에서 네트워크 동작이 편향되거나 불안정해질 가능성을 낮추도록 기반 구조를 재편했습니다. 그 결과 실제 Solana 운영에서 성능과 안정성을 함께 유지할 수 있도록 환경을 더 잘 구조화했습니다.
또한 네트워크 구성 변경과 플랫폼 업그레이드를 완전한 무중단으로 적용할 수 있는 운영 아키텍처로 전환했습니다. 가격, 사양, 인증, 레이트 리밋에는 변경이 없으며, 기존 ERPC 고객은 추가 설정이나 운영 변경 없이 이번 업그레이드의 혜택을 받습니다.

배경

실제 Solana 운영에서 평균 응답 시간과 평상시 지연 시간은 중요한 기본 요건입니다. 동시에 집중 부하가 발생하는 순간, 장시간 연결, 연결 끊김과 재연결이 발생하는 단계처럼 기반 네트워크 인프라 자체의 동작이 결과를 결정하는 상황도 있습니다.
특히 공유 엔드포인트는 짧은 시간 안에 발생하는 트랜잭션 제출의 폭증과 WebSocket 및 gRPC를 통한 상시 연결을 모두 수용해야 합니다. 이러한 조건에서는 연결 시작, TLS 핸드셰이크, 전송 동작, 캐시 처리, 유휴 상태에서의 복구 등 인프라 수준의 동작이 사용자 경험과 실행 결과에 직접 반영됩니다.
평균적인 응답성을 명확한 기준으로 삼더라도, 스파이크가 발생하거나 지속적으로 가동되는 동안의 실제 결과는 여러 요인에 의해 결정될 수 있습니다. 따라서 실제 운영에서는 일상적인 사용성과 장애가 발생하기 쉬운 상황에서의 연속성을 동시에 달성해야 합니다.
ERPC는 Solana 통신의 기반으로 자체 Rust 고성능 프록시 플랫폼을 설계하고 운영해 왔으며, 모든 지역에 동일한 접근 방식을 적용하면서 플랫폼을 지속적으로 발전시키는 아키텍처를 유지하고 있습니다. 이번 업그레이드에서는 연결 시작부터 장시간 운영까지 운영 중 관찰된 문제를 하나의 시스템으로 재검토하고, 이에 맞춰 전체 네트워크 기반을 재구성했습니다.

ERPC 고객에게 달라지는 점

이번 업데이트를 통해 ERPC 고객은 먼저 연결 시작 단계에서 안정화된 동작을 확인할 수 있습니다. TLS를 포함한 연결 수립 과정에서 조건 불일치와 불필요한 재시도가 발생할 가능성이 낮아져, 트랜잭션과 스트림이 시작부터 안정적으로 처리되기 쉬워졌습니다.
다음으로, 피크 부하에서 변동성을 유발하기 쉬운 인프라 동작을 재구성했습니다. 불필요한 연결을 조기에 필터링하고 HTTP/1.1 및 HTTP/2 전송과 타임아웃 일관성, 연결 풀 상태, 경합 상황에서의 캐시 동작, 관측 가능성과 문제 해결을 위한 메트릭을 동시에 업데이트해 부하가 집중될 때에도 편향된 동작을 방지하는 조건을 강화했습니다.
장시간 유지되는 WebSocket·gRPC 스트림과 상시 모니터링 워크로드에서는 연결 연속성이 개선되었습니다. 연결 끊김·재연결·재동기화 이벤트의 빈도와 이러한 이벤트가 결과로 연쇄될 가능성을 낮춰, 지속적인 실행을 전제로 운영을 구성하기 쉬워졌습니다.
캐시 제어와 전송 동작의 개선으로 혼잡 중 불필요한 재요청과 낭비되는 처리가 발생할 가능성도 줄었습니다. 대역폭과 처리 여유가 유용하고 안정적인 상태로 유지되기 쉬워졌으며, 확장된 메트릭과 관측 가능성을 통해 근본 원인을 파악하고 복구에 걸리는 시간을 단축하기 쉬워졌습니다.
또한 구성 변경과 플랫폼 업그레이드를 무중단으로 수행할 수 있게 되어, 높은 빈도로 성능·안정성·플랫폼 전반의 품질을 높이기 쉬운 운영 조건을 확립했습니다. 플랫폼을 멈추지 않고 계속 개선할 수 있는 능력은 고객의 연속성을 한층 강화합니다.

개선 사항의 세부 내용

이번 업그레이드는 특정 기능명이나 버전 번호를 중심으로 한 릴리스로 제시되지 않습니다. 대신 실제 Solana 결과를 좌우하기 쉬운 상황을 연결 시작, TLS, L4/HTTP 경계, H1/H2 전송, 캐시, 관측 가능성, 장애 동작, 장기 운영 전제 조건이라는 계층으로 나누고, 이 계층들이 모순 없이 이어지도록 플랫폼을 업데이트했습니다.
아래에서는 고객 경험과 운영 결과에 어떻게 기여하는지를 기준으로 통합된 개선 내용을 설명합니다.

연결 시작 및 TLS 처리 개선

연결 수립 과정에서 처리하는 TLS 컨텍스트를 확장하고, 필요한 상태를 보존해 적절히 적용할 수 있도록 구조를 업데이트했습니다. 이를 통해 연결 시작 시 조건 불일치와 불필요한 재시도가 발생할 가능성을 낮췄습니다.
인증서 검증과 호스트 이름 검증을 포함한 TLS 처리도 재구성했습니다. 보안 요건을 충족하면서 핸드셰이크 실패나 처리 불일치가 시작 단계의 손실을 만들고 결과로 연쇄되는 조건을 줄이기 위해서입니다. 이는 단순한 보안 개선에 그치지 않고, Solana 워크로드가 연결을 시작해 처리 단계로 진입할 때까지 동작을 안정화하는 데 기여합니다.
TLS와 인접한 동작을 더 쉽게 관찰하고 문제를 해결할 수 있도록 관련 메커니즘도 강화했습니다. 시작 단계가 결과를 좌우하는 상황에서는 문제를 재현하고 원인을 파악하며 수정 사항을 빠르게 반영하는 능력이 경험 품질을 유지하는 핵심 역량이 됩니다.

불필요한 연결의 조기 필터링을 통한 여유 용량 보존

TCP 연결을 초기 단계에서 필터링하는 메커니즘을 도입하고 플랫폼을 업데이트해, 비정상적이거나 불필요한 연결이 정상 트래픽을 압박할 가능성을 낮췄습니다. 공유 엔드포인트에서는 외부 요인이나 일시적인 편차로 연결 요청이 급증할 수 있습니다.
초기 필터링은 정상 연결이 시작 단계에서 멈출 가능성을 낮추고, 피크 부하 중에도 여유 용량을 사용할 수 있는 가능성을 높입니다. 그 결과 부하가 집중되는 상황에서도 동작이 편향될 가능성이 낮아지고, 안정적인 지연 시간 분포를 위한 조건이 강화됩니다.

L4/HTTP 경계를 재구성해 연결 모델을 명확히 함

네트워크 인프라는 HTTP에서 끝나지 않습니다. 연결 수립과 연속성은 L4 조건에 좌우되며, 해당 계층의 변동성은 상위 프로토콜 경험으로 전파됩니다.
이번 업데이트에서는 L4 스트림 처리를 추상화하고 구조를 재편해 연결 모델을 더 명확하게 처리할 수 있도록 했습니다. 연결이 계속 증가하고, 클라이언트 구현이 서로 다르며, 장시간 운영으로 상태 전환이 발생하는 상황에서도 플랫폼이 일관된 동작을 유지하기 쉬워졌습니다.
짧은 변동성이 사용자 경험으로 연쇄되는 패턴을 줄이도록 재시도 동작도 재구성했습니다. 실제 안정성은 개별 장애를 없애는 데만 의존하는 것이 아니라 장애의 연쇄를 방지하는 데 더 크게 좌우됩니다.

HTTP/1.1 및 HTTP/2 전송과 장시간 동작 개선

HTTP/1.1과 HTTP/2에서 전송된 데이터의 양을 일관되게 추적할 수 있는 측정 기능을 추가했습니다. 이를 통해 전송 파이프라인의 어느 지점에서 정체나 병목이 발생하는지 더 쉽게 파악할 수 있어 문제 해결과 수정 적용 속도가 향상됩니다.
집중 부하나 장시간 스트리밍 중 부자연스러운 정체와 멈춤이 발생할 가능성을 낮추도록 HTTP/2 본문 쓰기 타임아웃 동작도 재구성했습니다. 장시간 운영에서 중요한 것은 이상적인 상태의 최고 성능이 아니라 상태 전환 중 동작이 붕괴하지 않도록 하는 능력입니다.
지속적인 실행 중 누적되기 쉬운 불안정 요인을 제거하기 위해 유휴 타임아웃 동작과 연결 풀 처리도 재검토했습니다. HTTP/1.1 측면에서는 불완전한 요청을 보유한 연결에 대한 안전한 종료 동작을 재구성해 리소스 사용과 동작의 변동 원인을 줄였습니다.

캐시 제어 및 운영 품질 개선

자산이 캐시되지 않는 이유를 추적하는 능력을 개선해 캐시 동작을 더 쉽게 설명할 수 있도록 했습니다. 실제로 중요한 것은 캐시가 존재하는지 여부가 아니라 어떤 조건에서 적용되고 어떤 조건에서 해제되는지입니다.
피크 부하에서 경합이 발생할 때 경험 저하가 연쇄될 가능성을 낮추도록 잠금 동작, 오래된 데이터 처리, 재검증 패턴을 재구성했습니다. 캐시된 자산 수가 증가하는 경우를 위한 제거 제어도 정비하고, 실제 워크로드에서 불필요한 재요청과 지연을 줄일 수 있도록 Range 요청을 포함한 부분 콘텐츠 동작을 다듬었습니다.
이러한 개선으로 캐시 동작이 이상치가 되는 경우가 줄어들어, 고객이 인프라 수준의 불확실성을 전제로 운영을 설계해야 할 가능성이 낮아집니다.

장애 동작, 로깅 및 관측 가능성 개선

문제가 발생했을 때 무슨 일이 일어났는지 더 쉽게 이해할 수 있도록 장애 동작과 로깅을 재구성했습니다. 하위 시스템의 오류가 캐시·전송 동작으로 연쇄되어 경험을 악화시키는 패턴을 줄여 장애 영향 범위를 더 쉽게 국소화할 수 있습니다.
관측 가능성과 문제 해결의 개선은 ‘장애가 전혀 없다’고 주장하기 위한 것이 아니라, 장애가 발생했을 때 복구까지 걸리는 시간을 단축하기 위한 것입니다. 이는 피크 부하와 지속 운영 상황에서의 위험을 낮춥니다.

장기 운영 전제 조건으로서의 의존성 업데이트 및 보안 수정

장기적인 플랫폼 운영에 필요한 전제 조건을 유지하기 위해 의존성 업데이트와 보안 수정을 반영했습니다. 여기에는 최소 지원 Rust 버전(MSRV) 및 CI 정렬과 관련된 업데이트가 포함되며, 플랫폼을 지속적으로 발전시키는 데 필요한 기반을 강화합니다.
안전하게 계속 업데이트할 수 있는 능력 자체가 장기적인 품질을 위한 요건입니다.

무중단 운영으로의 전환

이전에는 네트워크 구성 변경이나 플랫폼 업그레이드 중 짧은 가동 중단이 발생할 수 있었습니다. 이번 업데이트를 통해 이러한 작업을 완전한 무중단으로 적용할 수 있는 아키텍처로 전환했습니다.
공유 엔드포인트에는 상시 연결이 존재하며 타이밍이 중요한 연속적인 순간들이 있습니다. 짧은 중단이라도 연결 끊김, 재연결, 재동기화의 연쇄를 촉발할 수 있고 그 비용이 결과로 전파될 수 있습니다. 무중단 업데이트는 이러한 연쇄가 발생할 가능성을 낮추고 장시간 운영이 분절되는 것을 방지합니다.
동시에 ERPC는 관찰된 문제를 빠르게 개선에 반영할 수 있는 운영 조건을 갖추게 되었습니다. 더 높은 반복 빈도는 프로덕션 운영 안에서 변동성과 경계 사례 동작을 지속적으로 제거할 수 있게 합니다.

서비스별 영향

Solana RPC (HTTP / WebSocket)

연결 시작, TLS, 캐시 제어, 전송 동작의 개선은 데이터 조회와 트랜잭션 제출 모두에 영향을 줍니다. 일상적인 사용성을 유지하면서 피크 부하에서 결과를 편향시키는 요인을 줄이고, 혼잡 중 여유 용량을 보존할 수 있는 조건을 강화했습니다.

Geyser gRPC

장시간 스트리밍 사용에서 연결 연속성이 개선되었습니다. HTTP/2 전송, 타임아웃 일관성, 연결 풀 상태, 확장된 전송 측정 기능이 함께 작동해 재연결·재동기화 비용이 결과로 전파될 가능성을 낮춥니다.

Shredstream (Direct Shreds)

지속적인 전달을 위해 설계된 연결 관리 및 시작 단계 개선을 통해 혼잡 중 데이터 누락이나 지연이 발생할 가능성을 낮추는 조건을 강화했습니다. 탐지와 추적을 위한 안정적인 연속성을 더 쉽게 유지할 수 있습니다.

R&D와 프로덕션 운영의 연결

ERPC를 포함하는 분산 시스템 기반은 네덜란드 정부의 WBSO 프로그램에 따른 R&D 프로젝트로 인정받았습니다. 운영 중 관찰된 문제를 연구 주제로 반영하고 검증과 반복을 통해 개선할 수 있는 구조가 마련되어 있습니다.
이번 네트워크 기반 업데이트는 모든 지역에 적용된 그러한 반복 중 하나이며, 실제 성능과 안정성에 반영되었습니다. 일회성 개선에서 멈추지 않고 프로덕션에서 관찰한 내용을 다음 업데이트로 계속 연결하려면 운영과 R&D의 연계가 전제되어야 합니다.
ERPC에서는 실제 사용 패턴, 부하 변동성, 장애 모드 동작을 반복적인 검증과 개선 주기에 반영해 네트워크 기반의 품질을 점진적으로 높이고 있습니다. 이번 업데이트도 R&D와 프로덕션 운영을 통합한 프레임워크 안에서 실행되었습니다.

고객 안내

이번 업데이트는 이미 모든 지역과 모든 공유 엔드포인트에 적용되었습니다. 기존 ERPC 고객은 구성이나 운영을 변경할 필요가 없습니다. 가격, 사양, 인증, 레이트 리밋에는 변경이 없습니다.
공유 엔드포인트는 짧은 스파이크와 장시간 연결을 동시에 유지해야 하므로, 이러한 혼합 워크로드에서 동작이 편향될 가능성을 낮추도록 조건을 재구성했습니다. 운영 중 구성 변경이나 플랫폼 업데이트가 발생하더라도 변경 사항은 무중단으로 적용되므로, 고객은 연결 분절이나 재동기화를 전제로 계획할 필요가 없습니다.
아키텍처, 워크로드별 최적화, 운영 피드백에 관한 문의는 Validators DAO 공식 Discord를 통해 연락해 주시기 바랍니다.
ERPC는 프로덕션 관찰과 피드백을 지속적으로 개선에 연결해 기반 품질을 점진적으로 높여 왔습니다. 앞으로도 무중단으로 개선을 축적하며 실제 Solana 결과를 뒷받침하는 네트워크 인프라를 제공하겠습니다.
Validators DAO 공식 Discord: https://discord.gg/C7ZQSrCkYR ERPC 공식 사이트: https://erpc.global/ko