Skip to content

7.4 Cohort Browser 사용하기

코호트 브라우저(Cohort Browser)는 승인된 데이터셋을 탐색하고 연구 목적에 적합한 대상자 집단을 선정하기 위한 기능입니다. 연구자는 임상 정보(Phenotype Data)와 유전체 정보(Genomic Data)를 조합하여 원하는 조건의 연구 대상자를 검색할 수 있습니다.

예를 들어 다음과 같은 연구 질문에 활용할 수 있습니다.

  • 당뇨병 환자 중 BMI가 30 이상인 대상자는 몇 명인가?
  • 유방암 환자 중 BRCA1 유전자 변이를 가진 대상자는 몇 명인가?

코호트 브라우저는 이러한 조건 검색을 통해 연구에 필요한 대상자 집단을 빠르게 구성할 수 있도록 지원합니다.

7.4.1 Cohort Browser 접속

Cohort Browser메뉴에서 Cohort Browser로 이동하면 연구자가 승인된 데이터셋을 기반으로 임상 데이터(Pheno Data)유전체 데이터(Genomic Data) 를 탐색하고, 선택된 대상자 집단의 특성을 시각적으로 분석할 수 있습니다.

Cohort Browser 화면

그림 7-3. Cohort Browser 화면

7.4.2 화면 구성 이해

Cohort Browser는 화면 영역별 역할을 먼저 익히면 사용이 쉬워집니다.

  • 상단에서는 프로젝트와 데이터셋을 선택하고,
  • 왼쪽에서는 조건을 설정하며,
  • 중앙에서는 결과와 분포를 확인하고,
  • 오른쪽에서는 저장된 데이터셋과 적용 조건을 확인합니다.

각 영역의 세부 항목은 아래를 참고하세요.

  1. 상단영역: 승인된 프로젝트 및 데이터셋 선택 Cohort Browser 상단 영역
    그림 7-4. Cohort Browser 상단 영역
  • Select Approved Set: 승인된 연구 프로젝트를 선택하는 영역. 연구자는 승인된 프로젝트 중 하나를 선택할 수 있으며, 선택된 프로젝트에 따라 접근 가능한 데이터 범위가 결정됩니다.
  • Select Data Set: 분석에 사용할 데이터셋을 선택하는 영역. 데이터셋은 연구 목적에 따라 구분될 수 있으며, 선택한 데이터셋에 따라 조회 가능한 대상자와 변수 정보가 달라질 수 있습니다.
  1. 좌측 영역: 임상 데이터 및 유전체 데이터 조건 및 필터 설정 Cohort Browser 좌측 영역 - Pheno Data
    그림 7-5. Cohort Browser 좌측 영역 - Pheno Data

Cohort Browser 좌측 영역 - Genomic Data
그림 7-6. Cohort Browser 좌측 영역 - Genomic Data

  • Pheno Data: 연구 대상자의 임상 정보 및 표현형 데이터를 기반으로 코호트를 탐색하는 기능이며, Phenotype 또는 Clinical term 기반으로 대상자 조건을 설정할 수 있습니다.
  • Genomic Data: 유전체(Genomic) 기반 조건을 사용하여 variant 및 대상자를 탐색합니다. 연구자는 염색체 위치, 유전자 정보, Variant 정보, Allele Frequency, Clinical Significance 등의 조건을 설정하여 원하는 variant를 검색할 수 있습니다.
  1. 중앙 영역: 대상자 요약 정보 및 시각화 결과 제공 Cohort Browser 중앙 영역

그림 7-7. Cohort Browser 중앙 영역

  • Selected Participants: 현재 조건에 해당하는 대상자 수를 표시
  • Summary: 대상자 요약 정보
  • Plot: 변수 분포 시각화
  • Variants: Variant 정보 확인
  1. 우측 영역: 저장된 데이터셋 및 적용 조건 확인 Cohort Browser 우측 영역
    그림 7-8. Cohort Browser 우측 영역
  • Dataset List: 연구자가 생성하거나 저장한 데이터셋 목록 확인
  • Filtered Condition: 현재 적용된 필터 조건 확인
  • Save Dataset: 현재 필터링 된 결과를 새로운 데이터셋으로 저장 가능

7.4.3 임상·유전체 조건으로 대상자 찾기

Phenotype 조건은

  • 참여자 ID
  • 시점
  • 가족 ID
  • 신장
  • 체중
  • 성별

등 실제 데이터 변수 기반으로 대상자를 탐색할 때 사용합니다.

Clinical term 조건은 ICD-10, SNOMED CT, HPO와 같은 표준 임상 용어 체계를 기반으로

  • 질병
  • 증상
  • 임상 개념

을 검색하는 기능입니다. 예를 들어 제2형 당뇨병, 고혈압, 청력 손실과 같은 개념을 표준 코드 기반으로 탐색할 수 있습니다.

질병명을 입력했을 때 여러 코드가 표시될 수 있으므로, 연구 목적에 맞는 코드 체계와 의미를 확인한 뒤 선택합니다.

Phenotype 조건 설정 화면
그림 7-9. Phenotype 조건 설정 화면

구분항목설명
Phenotype참여자 ID연구 대상자를 구분하기 위한 고유 식별자
Phenotype시점데이터가 수집된 시점 또는 방문 시점
Phenotype가족 ID가족 기반 연구에서 사용되는 식별 정보
Phenotype신장대상자의 키
Phenotype체중대상자의 체중
Phenotype성별대상자의 성별
Clinical termDisease (ICD-10)질병 및 진단 코드 기반 검색
Clinical termEMR (SNOMED-CT)전자의무기록 기반 임상 용어 검색
Clinical termOntology (HPO)표현형 및 증상 기반 검색

유전체 조건은 임상 조건보다 해석이 복잡할 수 있습니다. 염색체 위치, 유전자명, dbSNP ID, 변이 유형, 대립유전자 빈도, 임상적 의미를 조합할 때는 분석 목적과 선택한 기준이 일치하는지 확인합니다.

Genomic Data 조건 설정 화면
그림 7-10. Genomic Data 조건 설정 화면

구분항목설명
Genomic InformationLocation특정 염색체 위치를 기준으로 variant를 검색
Genomic InformationFeature IDs특정 유전자 또는 annotation 기반 검색
Genomic InformationdbSNP IDsdbSNP ID 기반 variant 검색
Genomic InformationVariant TypeVariant 유형 기반 필터링
Statistical InformationgnomAD Allele FrequencygnomAD 데이터베이스 기반 대립유전자 빈도 필터링
Statistical InformationGermline Classification생식세포(Germline) variant의 임상 중요도를 기준으로 필터링
- Benign: 병원성과 관련없음
- Likely bening: 병원성 가능성 낮음
- Uncertain significance : 의미 불명(VUS)
- Likely pathogenic: 병원성 가능성 높음
- Pathogenic: 병원성 variant
Statistical InformationSomatic Classification체세포(Somatic) variant의 임상 중요도를 기준으로 필터링
- tier i – strong: 강한 임상적 의미
- tier ii – potential: 잠재적 임상 의미
- tier iii – uncertain significance: 의미 불명
- tier iv – benign/likely benign: 양성 가능성 높음

7.4.4 필터 조건 확인과 데이터셋 저장

Filtered Condition에서 현재 적용된 조건을 확인하고, 조건에 맞는 결과를 Save Dataset으로 저장할 수 있습니다. 저장된 데이터셋은 이후 분석 단계에서 재사용할 수 있습니다.