Product

Datatrans

Parallel Data Transfer & Rule-Based Scrambling

Oracle 운영 데이터의 조건부 추출과 병렬 전송, 컬럼 매핑, 민감정보 스크램블링을 하나의 작업 정의로 연결하는 데이터 이관 솔루션입니다.

Datatrans / Transfer definition 개념도 / Interface concept
Oracle sourceOracle target
조건부 추출병렬 변환병렬 적재
추출 조건 예시STATUS = 'ACTIVE'
고객 테이블 전송과 스크램블링 규칙 예시
Source columnRuleTarget
CUSTOMER_ID직접 매핑CUST_ID
CUSTOMER_NAMESC_NAME가상 이름
EMAILCONSISTENT일관된 가상값
Python 규칙을 적용하고, 변환 결과를 검토한 뒤 이관합니다.

제품의 동작을 설명하기 위한 개념도이며, 실제 제품 화면이 아닙니다.

What is Datatrans?

대용량 데이터 전송부터 스크램블링까지

추출, 변환, 적재를 하나의 병렬 파이프라인으로 연결합니다. 데이터가 이동하는 과정에서 필요한 매핑과 보호 규칙을 적용합니다.

Oracle source / Datatrans pipeline / Oracle target처리 구조 개념도
  1. Extract / SAE

    스토리지 기반 병렬 추출

    스토리지 직접 접근과 가상 세그멘테이션으로 대용량 데이터를 처리 단위로 나눕니다.

  2. Transform / In-memory

    스크램블링과 컬럼 매핑

    중간 파일을 만들지 않고 메모리에서 민감정보를 변환하고 소스·타겟 컬럼을 연결합니다.

  3. Load / Parallel sessions

    타겟으로 병렬 적재

    타겟의 병렬 세션에 데이터를 전달합니다. 추출부터 적재까지 처리 구간을 함께 가동합니다.

한 작업 정의에서 조건부 추출, 병렬도, 컬럼 매핑, 스크램블링 규칙을 관리합니다.
Datatrans: Storage Access Engine

Oracle 대용량 테이블을 위한 핵심 엔진

SAE(Storage Access Engine)는 Oracle 대용량 테이블을 병렬 처리 단위로 나누어 추출하는 Datatrans의 핵심 엔진입니다. 스토리지 직접 접근과 가상 세그멘테이션으로 DB 인스턴스 부하와 중복 I/O를 줄이고, 비파티션·파티션·LOB 테이블의 안정적인 병렬 처리를 지원합니다.

비파티션 대용량 테이블

스토리지 직접 접근과 가상 세그멘테이션으로 대용량 단일 테이블도 고속 처리합니다.

파티션 테이블 (Data Skew)

파티션 크기와 데이터 Skew에 영향받지 않고 균일한 병렬 처리 성능을 제공합니다.

Large Object 포함 테이블

처리 부담이 큰 LOB 데이터도 분리·병렬 처리 구조로 안정적으로 전송합니다.

테이블 유형과 데이터 분포를 고려해 Oracle 대용량 데이터를 병렬 처리합니다.

Asynchronous Resource Orchestration

전 구간 동시 가동 비동기 병렬 아키텍처

SAE 기술로 분할된 데이터를 전 구간 동시에 가동하여 전체 공정의 속도를 극대화하고 장애 요인을 감소시킵니다.

Resource orchestration동시 가동 방식 비교 · 개념도

Legacy data processing

순차 처리와 중간 파일

  • 태스크별 자원 집중으로 작업 시간과 시스템 부담 증가
  • 업무시간 내 DB 병렬 작업의 자원 경합 가능성
  • Dump 파일과 FTP 전송에 필요한 추가 I/O 및 대역폭

Datatrans

비동기 파이프라인

  • 병렬도 조정으로 네트워크와 DB 자원 사용량 관리
  • 비동기 처리로 각 구간의 자원을 함께 활용
  • 추출·전송·변환·적재 구간의 동시 병렬 가동
각 단계의 겹침은 처리 구조를 설명한 개념 표현이며, 실행 시간이나 성능 측정값이 아닙니다.

개별 작업의 병렬화를 넘어, 전체 처리 구간의 자원 사용을 함께 설계합니다.

Performance

같은 데이터, 같은 환경에서 비교한 처리 시간

아래 수치는 동일한 Database·Network 조건에서 수행한 프로젝트 검증 결과입니다.

4TB 데이터 추출·적재

처리 시간 · 낮을수록 빠름
B사 D**** 솔루션12시간+
Datatrans2시간
대용량·LOB 처리와 프로세스 간 불균형이 나타난 비교 환경에서, 스토리지 접근과 리밸런싱을 포함한 병렬 처리 구조를 검증했습니다.
공공 K사 / 테스트 데이터 구축

1TB 스크램블링 데이터 전송

4시간+40분

동일 Database·Network 환경의 프로젝트 검증 결과입니다. 데이터 유형, 스크램블링 규칙과 사용 환경에 따라 실제 처리 시간은 달라질 수 있습니다.

Data Scrambling

개발·테스트 데이터의 노출 위험을 낮추는 스크램블링

Data Scrambling은 운영 데이터를 복제하는 과정에서 개인정보에 변환 규칙을 적용합니다. 보호 대상과 변환 규칙을 정의해 개인정보 노출 위험을 줄이고, 운영 데이터의 활용성을 유지하도록 돕습니다.

IT 부서의 업무 효율 최적화

운영 환경과 동일한 고품질 테스트 데이터 제공으로 IT 운영비용 증가를 방지합니다.

컴플라이언스 대응 지원

관련 법률의 보호 대상에 맞춘 스크램블링 규칙 운영으로 조직의 개인정보 보호 조치 이행을 지원합니다.

운영 데이터 노출 리스크 관리

개발·테스트 환경으로 전달되는 운영 데이터의 불필요한 민감정보 노출을 줄입니다.

보호할 항목을 정의하고,
업무에 맞는 규칙을 적용합니다.

데이터의 활용 목적과 관련 법률을 기준으로 보호 대상을 정합니다. 변환 후에도 필요한 참조 관계와 업무 규칙이 유지되는지 검증합니다.

보호 대상
식별정보 · 신용정보 · 인증정보
적용 방식
도메인 규칙 · Python 함수 · 암호화 키 변환
확인 사항
변환 결과 · 참조 무결성 · 노출 위험

개인정보 항목별 관련 법률 및 스크램블링 지원

개인정보 항목 관련 법률 및 근거
주민등록번호 / 고유식별정보 개인정보보호법
신용카드 / 계좌 / 신용정보 신용정보의 이용 및 보호에 관한 법률
비밀번호 / 인증정보 개인정보보호법 (인증정보 보호)
금융거래(투자)정보 / 거래정보 금융실명거래 및 비밀보장에 관한 법률
연계정보 (CI/DI) 연계정보의 생성·처리 등에 관한 기준
위치정보 위치정보의 보호 및 이용 등에 관한 법률

암호화 키 변환 — 운영 키를 테스트·개발용 키로 전환하며, cubeOne 적용 사례 외 솔루션은 프로젝트 환경에 따라 연동 범위를 사전 검토합니다.

Scrambling for Any Data, at Any Scale

업무 데이터에 맞춰 확장하는 스크램블링 규칙

기본 변환 규칙에 Python 함수와 LLM 연계를 더해 정형 컬럼과 텍스트 데이터의 비식별화 범위를 확장할 수 있습니다.

AI & LLM 기반 스크램블링

  • Python 규칙 확장 — 업무별 변환 함수를 작성해 프로젝트 규칙으로 적용
  • 문맥 기반 합성 데이터 — LLM 연동으로 문장 구조 자체를 재구성
  • 텍스트 데이터 지원 — 이메일 본문, 상담로그 등 문장형 데이터 비식별화

스크램블링 데이터의 정합성 보장

  • CONSISTENT 적용 설계 — 같은 domain과 input을 관계 컬럼에 적용하고 Target 무결성을 별도로 검증
  • 도메인 기반 — 흩어진 동일 데이터를 일관된 가상값으로 변환, 업무 규칙 유지
  • 정교한 테스트 환경 — 테스트 데이터 불일치로 인한 리소스 낭비 방지

In-Memory 기반 추출·변환 아키텍처

  • 원천 데이터를 파일로 저장하지 않고 바로 스크램블링·적재
  • 중간 파일을 만들지 않아 처리 과정의 불필요한 데이터 노출 지점을 축소
  • 프로세스 간 데이터 교환으로 스크램블링 정합성 확보

지능형 개인정보 탐색 엔진 탑재

데이터베이스 내 숨겨진 보호 대상을 AI 기반 로직으로 자동 식별합니다.

패턴 인식 (Regex) 개체명 인식 (NER) 체크섬 검증 문맥 키워드 분석 비식별화 대상 확정

INPUT: 안녕하세요, 제 이름은 이나경이고 연락처는 010-9876-5432 입니다.
OUTPUT: 안녕하세요, 제 이름은 <PERSON>이고 연락처는 <PHONE_NUMBER>입니다.

Data Mapping

서로 다른 구조의 테이블에도 데이터 전송·스크램블링

소스 컬럼을 직접 연결하거나 SQL 변환식을 적용해 타겟 구조에 맞춥니다. 매핑 정의를 YAML로 공유하고 재사용합니다.

yaml
mappings:
  customer_mapping:
    source:
      owner: SRC_USER
      table_name: CUSTOMER
      condition: STATUS = 'ACTIVE'
    target:
      owner: TGT_USER
      table_name: CUSTOMER_COPY
    columns:
      # Case A (직접 매핑)
      - target_column: CUST_ID
        source_column: CUSTOMER_ID
      # Case B (데이터 변환)
      - target_column: FULL_NAME
        conversion_rule: "FIRST_NAME || ' ' || LAST_NAME"

직관적인 컬럼 매핑

소스와 타겟 컬럼을 1:1로 연결하고 작업 정의에서 대응 관계를 확인합니다.

다양한 변환 규칙 적용

단순한 이동을 넘어 함수나 문자열 기반의 변환 규칙을 단일 시스템 내에서 통합 관리합니다.

표준 YAML 포맷 채택

YAML의 mappings: 구조를 CLI mapping_rule로 지정해 공유하고 재사용합니다.

CLI & Dashboard

CLI를 통한 작업, 대시보드를 통한 모니터링

Datatrans는 반복적이고 복잡한 데이터 작업을 효율적으로 수행하기 위해 CLI 기반 처리 방식을 채택했습니다. 잘 정의된 텍스트 양식으로 작업 복사·수정·재사용이 쉬워지고 대량 작업의 생산성이 높아집니다. UI 조작의 번거로움과 리소스 사용을 줄이면서도, 대시보드를 통해 작업 상태를 직관적으로 확인할 수 있습니다.

bash
datatrans source=SRC_USER/password@host:1521/SRCDB \
          target=TGT_USER/password@host:1521/TGTDB \
          schemas=SALES \
          degree=8 \
          table_action=APPEND \
          jobname=SALES_TRANSFER

datatrans
# DATATRANS> STATUS=SALES_TRANSFER
# DATATRANS> PROGRESS=SALES_TRANSFER

KEY=VALUE 파라미터 방식

parfile로 접속 정보와 옵션을 재사용하고, 작업 정의를 버전 관리할 수 있습니다.

다양한 모드 지원

TRANSFER(기본), TRIGGER(Repository 자동 감시), PREVIEW(사전 검증) 모드를 지원합니다.

대시보드 모니터링

작업 상태·진행률·실행 이력을 웹 대시보드에서 직관적으로 확인합니다.

Reference

검증된 실전 적용 사례

금융·공공 프로젝트에서 기록된 적용 범위와 처리 결과를 소개합니다.

약 4TB

금융 S사 — 차세대 프로젝트

차세대 프로젝트에서 As-Is → Staging → To-Be 데이터 이행에 적용. 약 4TB 데이터의 추출·적재를 Database 및 Network 구간의 전 영역 병렬 처리를 통해 완료.

차세대4TBStaging
4시간 → 40분

공공 K사 — 테스트 데이터 구축

기존 B사 스크램블링 솔루션은 운영DB와 개발DB 간 데이터 전송에 4시간 이상 소요. Datatrans는 1TB 처리당 40분으로 단축, 대용량 테이블 전 구간 병렬 처리로 성능 향상.

스크램블링1TB/40분성능
매핑 + 스크램블링

공공 B기관 — 차세대 프로젝트

As-Is → To-Be 데이터 매핑 규칙과 추출 조건을 적용해 운영 데이터를 전환 환경에 제공. 민감정보는 스크램블링하여 개발 환경에 제공하고 To-Be 대상 적재까지 수행.

매핑스크램블링차세대

Datatrans로 데이터 이관과 보호를 시작하세요

데이터 규모와 이관 조건, 보호해야 할 항목을 알려 주세요. 환경에 맞는 작업 정의와 검증 방법을 함께 검토합니다.