DATA WITHOUT SILOS
흩어진 데이터를 모아
BI와 AI가 함께 쓰게 합니다.
Tarantula Lakehouse는 정형·반정형·비정형 데이터를 개방형 테이블 포맷으로 통합하고, 저장과 컴퓨팅을 분리해 SQL 분석과 AI/ML 워크로드를 함께 지원합니다. 민감 데이터는 내부에 유지하면서도 데이터 규모와 분석 수요에 맞춰 유연하게 확장할 수 있습니다.
WHY LAKEHOUSE
Data Lake와 Warehouse의 장점을 하나의 운영 모델로
데이터 통합
업무 DB, 로그, 파일, 이미지와 외부 데이터를 하나의 저장 계층으로 모아 부서별 사일로를 줄입니다.
- 정형 + 비정형 모두 저장
고성능 SQL
분산 SQL 엔진과 컬럼형 데이터 구조를 활용해 대규모 집계·조인과 대화형 분석을 처리합니다.
- Trino MPP SQL Engine
저장 효율
오브젝트 스토리지와 압축을 이용해 장기 보관 비용을 낮추고 데이터 자산의 활용 기간을 늘립니다.
- ToS (Tarantula Object Storage)
개방성
표준 포맷과 인터페이스를 채택해 특정 분석도구나 클라우드에 종속되지 않는 데이터 기반을 만듭니다.
- 오픈데이터포맷 Iceberg
AI Ready
동일한 데이터에서 BI, 데이터 과학, 모델 학습과 RAG 파이프라인을 연결합니다.
- S3 API 100% 호환
하이브리드
온프레미스를 중심으로 필요 시 클라우드 분석 서비스와 연계할 수 있는 확장 경로를 제공합니다.
- AWS, Snowflake 연계사례 보유
FLOW DIAGRAM
수집부터 분석·AI 활용까지
하나의 데이터 흐름
POC BENCHMARK
대규모 거래 데이터에서 확인한
집계·조인 처리 성능
PoC에서 수천만~수십억 건 규모의 정형데이터 집계와 조인을 측정한 결과입니다. 비교군 대비 뛰어난 분석 성능을 확인했습니다.
| 쿼리 부하 | 비교 A | 비교 B | Tarantula Lakehouse |
|---|---|---|---|
| 하루 집계 (천만 건) | 8초 | 0.7초 | 0.4초 |
| 한 달 집계 (수억 건) | 13초 | 1초 | 0.8초 |
| 1년 집계 (수십억 건) | 26초 | 2초 | 4초 |
| 두 테이블 하루 조인 | 12초 | 1.2초 | 1초 |
| 두 테이블 한 달 조인 | 29초 | 3.3초 | 2.5초 |
| 두 테이블 1년 조인 | 52초 | 15초 | 19초 |
CUSTOMER STORY / 대체거래소
급증하는 거래 데이터를
비용이 아닌 데이터 자산으로
초기 예측보다 4~5배 빠르게 증가한 거래 데이터를 장기간 보존하고 분석하기 위해 수억~수십억 건 대상 PoC를 수행했습니다. 성능·비용·활용성을 검증한 뒤 2025년 11월 구축을 시작해 약 4개월 만에 운영 기반을 완성했습니다.
DEPLOYMENT
작게 시작하고
데이터 성장에 맞춰 확장합니다.
최소 구성
병원, 연구소, 지자체, 중소규모 기업 등 프로젝트 연구 개발용입니다. 500GB~10TB 규모에 적합합니다. 초고속 정형데이터 분석을 제공하며 간단한 AI 프로젝트에도 적용할 수 있는 데이터 저장소입니다.
- Computing 영역 단일 구성
- Object Storage는 Community Version으로 제공
- 8×5 기술지원 / 긴급장애처리 1Day
권장 구성
금융, 제조, 유통 등 엔터프라이즈 Lakehouse입니다. 50TB 이상 규모에 적합하며 초고속 DW급 정형 데이터 분석과 정형/비정형 AI 워크로드를 위한 고가용성 확보된 최적의 데이터 플랫폼을 제공합니다.
- Computing 영역 HA 구성 및 Active-Active 확장
- Object Storage Enterprise 버전으로 제공
- 24 x 7 기술지원 / 긴급장애처리 4시간 이내
라이선스·용량 산정
라이선스와 서버 사양은 데이터 보유량, 일일 유입량, 동시 쿼리, 보존 기간과 가용성 수준을 기준으로 산정합니다.