logo
뉴스

회사 소식 스토리지 규모 KV 캐시 관리에 관한 Big Blue의 레드북

인증
중국 Beijing Qianxing Jietong Technology Co., Ltd. 인증
중국 Beijing Qianxing Jietong Technology Co., Ltd. 인증
고객 검토
베이징 첸싱 지에통 테크 주식회사의 영업 사원은 매우 전문적이고 참을성 있습니다. 그들은 빨리 인용을 제공할 수 있습니다. 제품의 품질과 패키징은 또한 매우 좋습니다. 우리의 협력은 매우 매끄럽습니다.

—— 《Festfing DV》LLC

내가 긴급히 인텔 CPU와 토시바 SSD를 찾고 있었늘 때, 베이징 첸싱 지에통 기술 주식회사로부터의 샌디는 나에게 많은 도움을 주었고, 나에게 빨리 필요로 한 제품을 가져다 주었습니다. 나는 정말로 그녀를 압니다.

—— 고양이 엔

베이징 첸싱 지에통 기술 주식회사의 샌디는 내가 서버를 구입할 때 제시간에 나에게 구성 오류를 상기시킬 수 있는 매우 주의깊은 판매원을 있습니다. 엔지니어들은 또한 매우 전문적이고, 빠르게 테스팅 프로세스를 완료할 수 있습니다.

—— 스트렐킨 미하일 블라드미로비치

베이징 첸싱지에통과의 협업에 매우 만족합니다. 제품 품질이 훌륭하고, 배송도 항상 제 시간에 이루어집니다. 영업팀은 전문적이고, 인내심이 많으며, 모든 질문에 매우 친절하게 답변해 줍니다. 그들의 지원에 진심으로 감사드리며, 장기적인 파트너십을 기대합니다. 강력 추천합니다!

—— Ahmad Navid

품질: 제 공급업체와의 좋은 경험. 미크로틱 RB3011은 이미 사용되었지만 매우 좋은 상태로 모든 것이 완벽하게 작동합니다. 통신은 빠르고 원활했습니다.그리고 제 모든 걱정은 빠르게 해결되었습니다.매우 신뢰할 수 있는 공급자

—— 제란 콜레시오

제가 지금 온라인 채팅 해요
회사 뉴스
스토리지 규모 KV 캐시 관리에 관한 Big Blue의 레드북

IBM 스토리지 스케일 병렬 파일 시스템은 NVIDIA 다이노와 결합된 분산 KV 캐시 관리를 지원하며 대규모 컨텍스트 워크로드와 대용량 AI 추론 시나리오를 제공합니다.

에 대한 최신 회사 뉴스 스토리지 규모 KV 캐시 관리에 관한 Big Blue의 레드북  0

IBM은 공식적인 레드북을 출시했습니다.한계 없는 맥락: 대규모 인공지능 추론을 위한 고성능 KV 캐시 플랫폼, 이 공동 솔루션에 대한 완전한 검증 된 참조 아키텍처를 제공합니다. 통합 스택은 Supermicro Petascale 스토리지 서버, NVIDIA 스펙트럼-X 이더넷 네트워크,그리고 IBM 스토리지 스케일 에러셔 코딩 에디션 (ECE) 을 통해 인공지능 추론을 위한 고성능 공유 스토리지 계층을 구축합니다.IBM ITSO (국제 기술 지원 조직) 에 의해 출판 된 권위 있는 기술 문서로서, IBM Redbooks는 실제,엔터프라이즈 수준의 IBM 인프라 제품들에 대한 심도 있는 배포 지침.

IBM, Supermicro 및 NVIDIA의 엔지니어링 팀이 공동으로 작성한 Redbook는 긴 컨텍스트 AI 워크로드의 핵심 통증점을 해결합니다.RAG 검색 응용 프로그램 및 자율 에이전트 파이프 라인은 GPU HBM 내부에서 대규모 KV 캐시 데이터를 생성합니다.캐시 된 데이터가 제한된 HBM 자원을 제거 한 후에는 반복적인 재 계산이 심각한 지연 증가로 이어집니다. 지속적인 크로스 요청 KV 캐시 스토리지가 필수적입니다.

이 솔루션은 5단계 계층적인 KV 캐시 아키텍처를 채택하여 다른 대기 시간 및 용량 요구 사항을 다루고 있습니다.
  • G1 계층: GPU 노드 로컬 HBM
  • G2 계층: CPU 노드 시스템 DRAM
  • G3 계층: 직접 연결된 로컬 SSD
  • G3.5 계층: 포드 수준의 공유 플래시 스토리지, GPU 서버 DPU에 직접 연결된 NVIDIA 블루필드 DPU가 앞장서고
  • G4 계층: 모든 GPU 컴퓨팅 서버에 연결된 외부 크로스 이더넷 공유 저장 풀
끝에서 끝까지 메모리 및 저장 계층을 커버하는 이 다단계 설정은 지속적인 지연 시간 및 용량 경사도를 제공합니다.자동 퇴거 및 전체 저장 스택에서 동적 데이터 재부하, 다양한 작업량 접근 패턴과 전체 인프라 비용 예산에 유연하게 적응합니다.

슈퍼마이크로 페타스케일 스토리지 서버에 배포된 스토리지 스케일 ECE는 G4 콜드 캐시 계층으로 사용됩니다. 이는 대기율에 민감하지 않은 KV 캐시 데이터에 최적화되어 있습니다.비활성 다회 회전 대화 상태 포함, 공유된 에이전트 컨텍스트 데이터 및 즉각적인 응답이 필요하지 않은 역사 질의 기록.

레드북에 기록된 테스트 결과에 따르면, 이 생산 준비가 된 참조 아키텍처는 생성 AI와 에이전틱 AI 추론 서비스를 효과적으로 가속화합니다.단일 요청 TTFT (Time To First Token) 테스트에서 외부 스토리지 스케일 KV 캐시 없이 독립적인 GPU 서버와 비교, 통합 시스템은 급격한 길이 변화에 관계없이 안정적인 TTFT를 유지합니다.56배 가속130k 토큰의 입력 순서 아래로 이동할 수 있고 긴 프롬프트 길이로 인한 추론 지연 변동을 완전히 제거합니다.

동시에 여러 사용자 추론 압력 아래에서 솔루션은 극적인 성능 향상을 달성합니다: 요청 처리량은 0.19 RPS에서 4.26 RPS로 증가합니다.22배의 처리량 증강한편, 200개의 추론 요청에 대한 전체 처리 시간은 95% 감소하여 GPU 활용 효율과 전체 추론 클러스터 확장성을 크게 향상시킵니다.

스택은 또한 가혹한 노이즈 이웃 스트레스 테스트에서도 강력한 성능을 유지합니다. 네 개의 클라이언트 끝으로 지속적 인 200 GB / s 경쟁 네트워크 I / O 트래픽을 생성합니다.통합 시스템은 여전히 안정적으로 작동합니다..6 RPS, 55.56초 안에 200개의 추론 요청을 모두 완료합니다.18배 더 높습니다.기본 GPU 전용 재 계산 아키텍처보다

연구팀은 레드북에서 결론을 내렸습니다. 비싼 GPU 하드웨어 투자에 대한 ROI를 극대화하려는 기업을 위해,이 검증된 통합 아키텍처는 간단한,추론 처리량을 높이기 위한 생산 준비가 된 접근, 끝에서 끝까지의 지연을 줄이고 더 높은 서비스 동시성을 지원하고 더 비용 효율적인 대규모 AI 추론 인프라를 구축합니다.

키워드: SUPERMICRO, IBM 스토리지 스케일, NVIDIA 다이노

베이징 첸징 지에텐 기술 회사, Ltd
샌디 양/글로벌 전략 책임자
왓츠앱 / 위ቻ트: +86 13426366826
이메일: yangyd@qianxingdata.com
웹사이트: www.qianxingdata.com/www.storagesserver.com
비즈니스 초점:
ICT 제품 유통/시스템 통합 및 서비스/인프라 솔루션
20년 이상의 IT 유통 경험을 바탕으로, 우리는 신뢰할 수 있는 제품과 전문적인 서비스를 제공하기 위해 세계적인 대표 브랜드와 파트너십을 맺습니다.
지능형 세계를 만들기 위해 기술을 사용하세요
선술집 시간 : 2026-06-12 11:09:46 >> 뉴스 명부
연락처 세부 사항
Beijing Qianxing Jietong Technology Co., Ltd.

담당자: Ms. Sandy Yang

전화 번호: 13426366826

회사에 직접 문의 보내기 (0 / 3000)