오라클 클라우드 인프라 (OCI), WEKA NeuralMesh 및 증강 메모리 그리드 소프트웨어를 실행하면 10배 더 높은 토큰 처리량, 10배 더 많은 동시 사용자 및 GPU 당 7배 더 많은 토큰을 제공합니다.로컬 DRAM에만 의존하는 표준 OCI 환경과 비교하면.
WEKA의 증강 메모리 그리드는 NeuralMesh를 통해 외부 스토리지를 활용하여 AI 추론을 위해 GPU 서버 메모리를 확장하여 외부 리소스를 고성능 KV 캐시로 전환합니다.마이크로초 지연 속도와 멀티 GB/s 대역폭을 제공합니다, 최대 페타바이트의 추가 메모리 주소 공간을 제공하며, NVIDIA의 SX KV 캐시 아키텍처와 완벽하게 호환됩니다. NeuralMesh는 WEKA의 고성능 AI 파일 시스템입니다.모든 벤치마이크는 9 노드 OCI naked-metal H100 클러스터에서 1001,000-토큰 컨텍스트 윈도우.
OCI의 소프트웨어 개발 수석 이사인 파블로 살렘 (Pablo Salem) 은 "기업 인공지능 워크로드는 컨텍스트 창을 계속 확장하고 GPU 활용도를 새로운 한계로 끌어올리고 있다"고 말했다.이 벤치마크는 WEKA의 솔루션이 OCI의 GPU 메모리 병목을 제거한다는 것을 증명합니다., 추가 GPU 하드웨어 투자 없이 더 크고 더 까다로운 추론 작업 부하를 가능하게 합니다.
WEKA는 추론 수요가 늘어나면서 인공지능 인프라의 비효율성이 증폭되고 있다고 지적합니다.사용자 경험을 손상시키고 토큰 당 운영 비용을 증가시킵니다.100,000 토큰 이상의 입력과 함께 긴 맥락 및 에이전티 AI 워크로드의 경우 이러한 오버헤드는 생산 AI 배포의 단위 경제를 심각하게 손상시킵니다.
벤치마크는 9개의 노드, 72개의 H100 GPU, 10만개의 토큰 컨텍스트 윈도우 및 수천 명의 동시 사용자에 기반을 두고 있으며, 아래와 같이 성능 격차가 명확하다.
-
동시 사용자 용량: WEKA는 DRAM 전용 설정에서 600 명에 비해 5,000 명 이상의 동시 사용자를 지원합니다. 활성 캐시를 8.64 TiB DRAM에서 287 TiB NVMe 플래시 스토리지로 확장함으로써 캐시 포화 실패를 방지합니다.추가 GPU 구매 없이 기존 GPU 하드웨어의 ROI를 극대화.
-
토큰 처리량: WEKA 스택은 초당 약 200만개의 토큰을 기록했고, DRAM 전용 시스템의 초반기 기준인 초당 200,000개의 토큰보다 10배 더 빨라졌습니다.
-
토큰 처리량 총: 2400명의 동시 사용자를 대상으로 한 1시간의 테스트에서 WEKA는 50억개의 토큰을 처리했고, DRAM 전용 설정은 7억개의 토큰만을 처리했습니다.
에이전틱 인공지능 워크플로우의 경우, DRAM의 부족은 캐시 포화 후 GPU의 지속적인 재 계산을 유발하여 토큰당 비용을 높이고 ROI를 낮추는 것입니다.WEKA는 생산 AI 서비스에 대한 전체 토큰 비용을 크게 절감합니다..
검색, 요약, 코드 지원 및 멀티 턴 에이전트를 포함한 실시간 AI 서비스의 경우 토큰 처리량은 사용자 용량에 대한 서비스 제한을 정의합니다.반응 속도와 인프라 수익 잠재력10배의 처리량 향상으로 OCI 클러스터 내부의 GPU 컴퓨팅 파워가 완전히 풀립니다.
요컨대, WEKA의 메모리 확장 소프트웨어는 클라우드 플랫폼이 더 많은 사용자에게 서비스를 제공하고 더 많은 토큰을 처리하고 운영 비용을 효과적으로 절감할 수 있도록 돕습니다.
WEKA의 CEO 인 Liran Zvibel는 "추론 성능은 사용 가능한 GPU 효과적인 메모리로 인해 병목이됩니다. 이러한 결과는 하드웨어 업그레이드만으로 AI 토큰 경제적 문제를 해결할 수 없다는 것을 증명합니다.실제 제한은 GPU 성능을 제한하는 오랜 메모리 벽입니다.OCI에 대한 WEKA의 솔루션은 소유의 총 비용을 최적화하여 토큰 처리 용량을 크게 증가시킵니다.
OCI는 공식 AI & 데이터 과학 블로그에서 전체 벤치마크 방법론, 시스템 구성 및 완전한 테스트 결과를 발표했습니다.
증강 메모리 그리드와 함께 NeuralMesh는 이제 WEKA 고객에게 일반적으로 제공되며 Oracle Marketplace에 상장되어 있으며, OCI는 독점 클라우드 런칭 파트너로 활동합니다.OCI에 대한 긴 맥락 추론을 실행하는 기업은 이 생산 준비가 된, 즉시 완전히 검증 된 건축물.
베이징 첸징 지에텐 기술 회사, Ltd
샌디 양/글로벌 전략 책임자
왓츠앱 / 위ቻ트: +86 13426366826
이메일: yangyd@qianxingdata.com
웹사이트: www.qianxingdata.com/www.storagesserver.com
비즈니스 초점:
ICT 제품 유통/시스템 통합 및 서비스/인프라 솔루션
20년 이상의 IT 유통 경험을 바탕으로, 우리는 신뢰할 수 있는 제품과 전문적인 서비스를 제공하기 위해 세계적인 대표 브랜드와 파트너십을 맺습니다.
지능형 세계를 만들기 위해 기술을 사용하세요