Skip to content

14. HPC 자원 활용하기 ​

개요

이 장에서는 BBP 연구환경 내에서 제공되는 분석 작업용 Pod(JupyterHub) 를 통해 Slurm 클러스터, Spark(Hail 전용) 클러스터와 공유 스토리지 같은 분석 인프라를 활용하는 방법을 설명합니다.

  • 대상: BBP의 데이터와 연구 환경을 분양 받고 분석을 수행하는 연구자
  • 전제: 연구자는 VPN과 VDI와 같은 보안 솔루션을 이용하여 연구환경으로 접근 할 수 있고, 기본적인 리눅스 셸 사용법(파일 탐색, 권한, 편집기 등) 숙지하고 원격 서버 접속 및 활용 경험을 보유함

데이터 보안 교육은 별도 진행

민감 데이터 취급, 결과물 반출 절차 등 데이터 거버넌스 전반은 별도 교육에서 다룹니다. 이 문서에서는 각 작업 단계에서 반드시 지켜야 할 보안 주의사항만 해당 챕터에 함께 표시합니다.

이 장에서는,

을 안내합니다.

시작하기 전에

  • BBP의 연구환경은 외부 인터넷에 직접 연결되지 않습니다. 패키지 설치는 폐쇄망내 conda repository 등 내부 저장소를 사용합니다.
  • 데이터의 연구환경 외부 반·출입은 정해진 절차를 통해서만 가능하며, 이는 별도 보안 교육에서 안내합니다.
  • 외부 공개 도메인(pip의 PyPI, conda의 anaconda.org 등)으로의 접근은 차단되어 있는 대신, 동일한 Repository가 폐쇄망 내부에 제공되어 있습니다.

용어 정의 ​

용어설명
Pod쿠버네티스에서 실행되는 분석 작업용 컨테이너 환경. Jupyter Notebook이 실행되어 연구자가 분석 작얼을 수행하는 거점이자 다른 클러스터로의 진입점
Slurm배치 작업 스케줄러 기반 HPC 클러스터. sbatch/srun으로 작업을 제출
Spark분산 처리 프레임워크 기반 클러스터. 본 환경에서는 Hail 전용
HailSpark 위에서 동작하는 대규모 유전체 데이터 분석 라이브러리
파티션(Partition) / 큐(Queue)Slurm에서 노드를 묶어 작업을 배정하는 단위
공유 스토리지세 시스템에 동일 경로로 마운트된 저장 공간
FIFO선입선출. 먼저 요청한 작업(큐)을 먼저 실행하는 정책

문서 표기 규칙 ​

이 문서는 주요 디렉토리 또는 호스트명과 같이 변경 가능성이 있는 공통 정보를 본문에 직접 적지 않고 변수로 참조할 수 있도록 제공합니다. 실제 값은 14.1 환경 변수 정보의 표에서 한 번에 확인·관리합니다.

  • ${변수명} : 시스템마다 다른 미확정 값(호스트명, 경로 등). 예: ${SLURM_LOGIN_HOST}, ${SHARED_ROOT}

  • 강조 박스

    • ::: tip 유용한 팁
    • ::: warning 주의(데이터 손실·자원 낭비 가능)
    • ::: danger 보안·운영상 반드시 지켜야 할 사항

WARNING

명령어 예시에 등장하는 ${...} 값은 그대로 입력하면 동작하지 않습니다. 반드시 14.1 환경 변수 정보에서 확인한 실제 값으로 치환하거나, 2장에서 안내하는 환경 변수 파일을 source 한 뒤 사용하세요.