14.10 트러블슈팅 및 FAQ
증상별로 우선 확인할 사항을 정리했습니다. 해결되지 않으면 운영팀에 에러 메시지·작업 ID·시각과 함께 문의하세요.
14.10.1 접속·인증
Pod/Slurm/Spark에 접속이 안 됩니다.
- 호스트명·포트가 14.1장 환경 변수 정보 와 일치하는지 확인합니다.
- Pod에서
nc -zv ${SLURM_LOGIN_HOST} ${SLURM_SSH_PORT}로 네트워크 연결을 점검합니다(14.3.5 Jupyter Terminal에서 Slurm·Spark 연결 점검).
작업 도중 갑자기 연결이 끊겼습니다.
- 세션 끊김에 대비해
tmux/배치 제출을 사용합니다(14.9.1 장시간 작업과 세션 끊김 대비). - 비밀번호 만료가 원인일 수 있습니다.
14.10.2 공유 스토리지
다른 시스템에서 만든 파일이 안 보입니다.
- 같은 절대 경로(
${WORK_DIR}/...)로 접근하고 있는지 확인합니다. 상대 경로/로컬 경로가 아닌지 점검합니다. - 마운트 상태를 확인합니다(
ls -ld ${SHARED_ROOT}). 보이지 않으면 운영팀에 문의합니다.
권한 거부(Permission denied)가 납니다.
ls -l로 소유자/그룹/권한을 확인합니다.
용량 부족(No space left)입니다.
du -sh로 사용량을 확인하고 불필요한 임시 파일을 정리합니다.${SCRATCH_DIR}활용을 검토합니다(14.4.4 용량(쿼터) 확인과 정리).
14.10.3 Slurm
작업이 계속 PD(대기) 상태입니다.
- FIFO 정책상 앞선 작업이 자원을 점유 중일 수 있습니다(14.8 자원 사용 정책 및 에티켓).
squeue로 앞 작업을 확인합니다. - 요청 자원이 가용량보다 커서 배정이 안 될 수 있습니다.
sinfo로 가용 노드/자원을 확인하고 요청을 줄여봅니다.
작업이 바로 실패(F)합니다.
--output/--error로그를 확인합니다.- 메모리 초과면
--mem을, 시간 초과(TIMEOUT)면--time을 조정합니다.sacct로MaxRSS를 확인합니다. - conda 환경 활성화 경로가 맞는지(
conda activate ${CONDA_ENV_DIR}/...) 확인합니다.
14.10.4 Spark / Hail
Hail 작업이 시작은 되는데 워커에서 실패합니다.
tmp_dir가 공유 스토리지 경로인지 확인합니다(14.6.2 Hail 초기화). 로컬 경로면 분산 실행이 실패합니다.- 입력/출력 경로가 공유 스토리지의 동일 경로인지 확인합니다.
자원이 부족하거나 다른 작업이 멈춰 보입니다.
- Spark UI(
http://${SPARK_MASTER_HOST}:${SPARK_UI_PORT})에서 한 애플리케이션이 전체 코어를 점유 중인지 확인합니다. - 본인 작업에
--total-executor-cores상한을 지정합니다(14.6.3 Spark 자원 지정).
버전 관련 오류가 납니다.
- Spark/Hail 버전은 운영팀이 구성한 것을 그대로 사용해야 합니다. 임의 설치·변경을 하지 않았는지 확인하고, 문제가 지속되면 운영팀에 문의합니다.
14.10.5 자주 묻는 질문
Q. Pod에서 만든 스크립트를 Slurm으로 옮겨야 하나요? A. 아니요. 공유 스토리지에 두면 같은 경로로 Slurm·Spark에서 그대로 실행됩니다(14.4. 공유 스토리지 활용).
Q. Hail을 Slurm에서 sbatch로 돌려도 되나요? A. 아니오. Spark와 Slurm은 별개 클러스터이며 Hail은 Spark에서 실행합니다(14.6 Spark(Hail) 접근 및 분석).
Q. Spark에 필요한 파이썬 패키지를 설치하려면? A. Spark는 Hail 전용 관리 환경이라 사용자가 설치하지 않습니다. 일반 패키지가 필요한 작업은 Pod/Slurm에서 conda로 구성하세요(## 14.3.3 conda 환경 구성 (내부 repository)).
Q. 외부에서 패키지를 받을 수 없습니다. A. 폐쇄망이므로 사내 conda 채널(${CONDA_CHANNEL})을 사용합니다. 설치 실패 시 채널 설정을 먼저 확인합니다.