Rebellions Inference Platform
AI 모델을 배포하세요.
추론을 확장하세요.
AI 서비스를 운영하세요.
업계 표준 소프트웨어 위에서 구축되었으며, Rebellions 하드웨어에 최적화되어 있습니다.
완전한 소프트웨어 스택
다섯 개의 레이어가 모델 파일부터 랙스케일 프로덕션까지 완벽하게 통합됩니다.
YOUR MODEL
지원 프레임워크 보기ML 프레임워크
이미 사용하고 계신 프레임워크로 그대로 시작하세요. 마이그레이션도, 재학습도 필요 없습니다.
기존의 PyTorch, TensorFlow, Hugging Face 모델을 그대로 활용할 수 있습니다. Rebellions SDK가 현재 워크플로우에 그대로 연동되므로, 모델 코드를 다시 작성하거나 프레임워크를 바꿀 필요가 없습니다.
OPTIMIZE
컴파일러 문서 보기컴파일러
Rebellions NPU가 실행할 수 있는 명령어로 모델을 변환하며, 성능 최적화가 자동으로 이루어집니다.
한 번의 컴파일 과정으로 모델을 하드웨어 최적화 바이너리로 변환합니다. 프론트엔드 컴파일러가 모델 추상화와 그래프 최적화를 담당하고, 백엔드 컴파일러가 NPU용 최종 커맨드 스트림을 생성합니다. 대부분의 모델은 코드 변경 없이 컴파일됩니다.
COMPUTE
컴퓨트 라이브러리
CNN부터 최신 LLM까지, 모든 모델 추론을 뒷받침하는 NPU 최적화 수학 연산의 포괄적인 라이브러리입니다.
GEMM, LayerNorm, 어텐션 커널 등 수백 개의 저수준 연산이 Rebellions Neural Engine에 맞춰 사전 최적화되어 있습니다. 이것이 빠른 추론을 가능하게 하는 핵심이며, SK가 릴리스될 때마다 새로운 모델 아키텍처를 지원하도록 계속 확장됩니다.
EXECUTE
런타임 API 보기런타임 모듈
서빙 프레임워크와 자연스럽게 통합되면서, NPU상의 메모리, 스케줄링, 처리량 등 모델 실행을 관리합니다.
런타임은 서빙 레이어(vLLM)와 하드웨어 사이에 위치합니다. 데이터 이동, 실행 스케줄링, 성능 모니터링을 처리하므로, 별도의 통합 코드 없이도 서빙 스택이 그대로 작동합니다.
INTERFACE
Kubernetes 통합 보기드라이버
OS와 오케스트레이션 레이어를 NPU에 연결하며, 클러스터 배포를 위한 네이티브 Kubernetes 디바이스 플러그인을 지원합니다.
커널 모드 드라이버(KMD)는 OS가 Rebellions NPU를 표준 컴퓨트 디바이스로 인식하게 합니다. 유저 모드 드라이버(UMD)는 애플리케이션 통합을 위한 깔끔한 API를 제공합니다. 클라우드 네이티브 배포를 위한 Kubernetes Device Plugin과 NPU Feature Discovery가 포함되어 있습니다.
CONTROL
펌웨어
칩 위에서 동작하는 가장 낮은 소프트웨어 레이어로, 메모리와 Neural Engine 전반의 워크로드를 조율하고 하드웨어 상태를 실시간으로 모니터링합니다.
펌웨어는 NPU의 메모리 계층과 Neural Engine 전반의 워크로드 스케줄링을 처리합니다. 칩 위에서 동작하며 SDK와 함께 업데이트됩니다. 상태 정보와 전력 지표는 Metrics Exporter를 통해 상위 스택의 Prometheus/Grafana로 전달됩니다.
HARDWARE
하드웨어 살펴보기Rebellions NPU
단일 가속기 카드부터 랙스케일 인프라까지, AI 추론을 위해 설계된 전용 하드웨어입니다.
위의 모든 레이어는 하드웨어와 함께 설계되어, 모델 파일부터 NPU 실행까지 전체 스택이 마찰 없이 작동합니다. 단일 RebelCard로 시작해 소프트웨어 스택 변경 없이 RebelServer, 이어서 RebelPOD까지 그대로 확장할 수 있습니다.
모델에서 서비스까지
기존 워크플로우 그대로, 프로덕션에 최적화됩니다.
모델 가져오기
PyTorch 또는 Hugging Face에서 불러오세요. 재학습이 필요 없습니다.
한 번에 컴파일
RBLN Compiler가 단 한 단계로 Rebellions NPU에 맞춰 모델을 최적화합니다.
기존 스택으로 서빙
vLLM을 통해 배포하세요. 별도의 통합 코드가 필요 없습니다.
마찰 없는 확장
동일한 소프트웨어 스택이 RebelServer, RebelRack, RebelPOD에서 그대로 동작합니다.
기존 AI 스택과 함께 동작합니다
벤더 종속이 없습니다.
팀에서 이미 사용 중인 도구와 그대로 호환됩니다.
추론 엔진
클라우드 및 오케스트레이션
인프라 도구
운영체제
AI 프레임워크
클라우드 네이티브 운영
자동화된 클러스터 통합
Rebellions NPU는 자동으로 탐지, 라벨링되어 Kubernetes 워크로드에서 사용할 수 있게 됩니다. 노드 기능 탐지부터 디바이스 플러그인 통합까지, 클러스터가 NPU가 준비된 노드를 인식하고 별도의 수동 설정 없이 추론 워크로드를 스케줄링할 수 있습니다.
간소화된 라이프사이클 관리
RBLN NPU Operator는 드라이버, 리소스 플러그인, 런타임 구성요소, 모니터링 에이전트를 포함한 전체 NPU 소프트웨어 스택을 Kubernetes 클러스터 전반에 배포·관리할 수 있게 지원합니다. RBLN NPU DRA Driver와 함께 사용하면 동적 리소스 할당과 유연한 스케줄링도 가능해, 멀티테넌트 환경에서의 프로덕션 규모 추론 워크로드를 지원합니다.
내장된 옵저버빌리티
NPU 사용률, 전력, 온도, 메모리 사용량, 디바이스 상태 지표가 Prometheus로 전송되어 기존 Grafana 대시보드에서 그대로 시각화됩니다. 별도의 모니터링 스택이 필요 없습니다.
엔터프라이즈 플랫폼 지원
Rebellions는 Kubernetes와 Red Hat OpenShift 환경을 지원하며, OpenShift AI와의 네이티브 통합을 통해 클라우드 네이티브·멀티테넌트·파트너 AI 플랫폼 전반에서 프로덕션급 추론 서비스를 제공할 수 있습니다.
서버에서 데이터센터까지, 자유로운 확장
동일한 소프트웨어 스택이 Rebellions 하드웨어의 모든 단계에서 그대로 동작합니다.
RebelServer™
멀티카드 서버 노드
RebelRack™
랙스케일 인프라
RebelPOD™
데이터센터급 배포
Rebellions을 선택해야 하는 이유
익숙함
네이티브 PyTorch와 오픈 생태계. 별도의 독점 프레임워크를 배울 필요가 없습니다.
효율성
하드웨어와 소프트웨어를 함께 최적화해 최고의 추론 성능을 이끌어냅니다.
확장성
단일 노드 배포부터 완전한 랙스케일 인프라까지 자유롭게 확장할 수 있습니다.
RBLN SDK로 시작하세요
SDK를 설치하고, 첫 모델을 컴파일한 뒤, 몇 분 만에 Rebellions 하드웨어에서 실행해보세요.
$ pip install rbln-sdk (compiler, vllm-rbln, …)
✓ RBLN SDK installed
$ rbln compile model file (safetensors, pt, …)
✓ Compiled for Rebellions NPU
$ rbln serve compiled_model --port 8000
