7.4 Cohort Browser 사용하기
코호트 브라우저(Cohort Browser)는 승인된 데이터셋을 탐색하고 연구 목적에 적합한 대상자 집단을 선정하기 위한 기능입니다. 연구자는 임상 정보(Phenotype Data)와 유전체 정보(Genomic Data)를 조합하여 원하는 조건의 연구 대상자를 검색할 수 있습니다.
예를 들어 다음과 같은 연구 질문에 활용할 수 있습니다.
- 당뇨병 환자 중 BMI가 30 이상인 대상자는 몇 명인가?
- 유방암 환자 중 BRCA1 유전자 변이를 가진 대상자는 몇 명인가?
코호트 브라우저는 이러한 조건 검색을 통해 연구에 필요한 대상자 집단을 빠르게 구성할 수 있도록 지원합니다.
7.4.1 Cohort Browser 접속
Cohort Browser메뉴에서 Cohort Browser로 이동하면 연구자가 승인된 데이터셋을 기반으로 임상 데이터(Pheno Data) 및 유전체 데이터(Genomic Data) 를 탐색하고, 선택된 대상자 집단의 특성을 시각적으로 분석할 수 있습니다.

그림 7-3. Cohort Browser 화면
7.4.2 화면 구성 이해
Cohort Browser는 화면 영역별 역할을 먼저 익히면 사용이 쉬워집니다.
- 상단에서는 프로젝트와 데이터셋을 선택하고,
- 왼쪽에서는 조건을 설정하며,
- 중앙에서는 결과와 분포를 확인하고,
- 오른쪽에서는 저장된 데이터셋과 적용 조건을 확인합니다.
각 영역의 세부 항목은 아래를 참고하세요.
- 상단영역: 승인된 프로젝트 및 데이터셋 선택
그림 7-4. Cohort Browser 상단 영역
- Select Approved Set: 승인된 연구 프로젝트를 선택하는 영역. 연구자는 승인된 프로젝트 중 하나를 선택할 수 있으며, 선택된 프로젝트에 따라 접근 가능한 데이터 범위가 결정됩니다.
- Select Data Set: 분석에 사용할 데이터셋을 선택하는 영역. 데이터셋은 연구 목적에 따라 구분될 수 있으며, 선택한 데이터셋에 따라 조회 가능한 대상자와 변수 정보가 달라질 수 있습니다.
- 좌측 영역: 임상 데이터 및 유전체 데이터 조건 및 필터 설정
그림 7-5. Cohort Browser 좌측 영역 - Pheno Data
그림 7-6. Cohort Browser 좌측 영역 - Genomic Data
- Pheno Data: 연구 대상자의 임상 정보 및 표현형 데이터를 기반으로 코호트를 탐색하는 기능이며, Phenotype 또는 Clinical term 기반으로 대상자 조건을 설정할 수 있습니다.
- Genomic Data: 유전체(Genomic) 기반 조건을 사용하여 variant 및 대상자를 탐색합니다. 연구자는 염색체 위치, 유전자 정보, Variant 정보, Allele Frequency, Clinical Significance 등의 조건을 설정하여 원하는 variant를 검색할 수 있습니다.
- 중앙 영역: 대상자 요약 정보 및 시각화 결과 제공

그림 7-7. Cohort Browser 중앙 영역
- Selected Participants: 현재 조건에 해당하는 대상자 수를 표시
- Summary: 대상자 요약 정보
- Plot: 변수 분포 시각화
- Variants: Variant 정보 확인
- 우측 영역: 저장된 데이터셋 및 적용 조건 확인
그림 7-8. Cohort Browser 우측 영역
- Dataset List: 연구자가 생성하거나 저장한 데이터셋 목록 확인
- Filtered Condition: 현재 적용된 필터 조건 확인
- Save Dataset: 현재 필터링 된 결과를 새로운 데이터셋으로 저장 가능
7.4.3 임상·유전체 조건으로 대상자 찾기
Phenotype 조건은
- 참여자 ID
- 시점
- 가족 ID
- 신장
- 체중
- 성별
등 실제 데이터 변수 기반으로 대상자를 탐색할 때 사용합니다.
Clinical term 조건은 ICD-10, SNOMED CT, HPO와 같은 표준 임상 용어 체계를 기반으로
- 질병
- 증상
- 임상 개념
을 검색하는 기능입니다. 예를 들어 제2형 당뇨병, 고혈압, 청력 손실과 같은 개념을 표준 코드 기반으로 탐색할 수 있습니다.
질병명을 입력했을 때 여러 코드가 표시될 수 있으므로, 연구 목적에 맞는 코드 체계와 의미를 확인한 뒤 선택합니다.
그림 7-9. Phenotype 조건 설정 화면
| 구분 | 항목 | 설명 |
|---|---|---|
| Phenotype | 참여자 ID | 연구 대상자를 구분하기 위한 고유 식별자 |
| Phenotype | 시점 | 데이터가 수집된 시점 또는 방문 시점 |
| Phenotype | 가족 ID | 가족 기반 연구에서 사용되는 식별 정보 |
| Phenotype | 신장 | 대상자의 키 |
| Phenotype | 체중 | 대상자의 체중 |
| Phenotype | 성별 | 대상자의 성별 |
| Clinical term | Disease (ICD-10) | 질병 및 진단 코드 기반 검색 |
| Clinical term | EMR (SNOMED-CT) | 전자의무기록 기반 임상 용어 검색 |
| Clinical term | Ontology (HPO) | 표현형 및 증상 기반 검색 |
유전체 조건은 임상 조건보다 해석이 복잡할 수 있습니다. 염색체 위치, 유전자명, dbSNP ID, 변이 유형, 대립유전자 빈도, 임상적 의미를 조합할 때는 분석 목적과 선택한 기준이 일치하는지 확인합니다.
그림 7-10. Genomic Data 조건 설정 화면
| 구분 | 항목 | 설명 |
|---|---|---|
| Genomic Information | Location | 특정 염색체 위치를 기준으로 variant를 검색 |
| Genomic Information | Feature IDs | 특정 유전자 또는 annotation 기반 검색 |
| Genomic Information | dbSNP IDs | dbSNP ID 기반 variant 검색 |
| Genomic Information | Variant Type | Variant 유형 기반 필터링 |
| Statistical Information | gnomAD Allele Frequency | gnomAD 데이터베이스 기반 대립유전자 빈도 필터링 |
| Statistical Information | Germline Classification | 생식세포(Germline) variant의 임상 중요도를 기준으로 필터링 - Benign: 병원성과 관련없음 - Likely bening: 병원성 가능성 낮음 - Uncertain significance : 의미 불명(VUS) - Likely pathogenic: 병원성 가능성 높음 - Pathogenic: 병원성 variant |
| Statistical Information | Somatic Classification | 체세포(Somatic) variant의 임상 중요도를 기준으로 필터링 - tier i – strong: 강한 임상적 의미 - tier ii – potential: 잠재적 임상 의미 - tier iii – uncertain significance: 의미 불명 - tier iv – benign/likely benign: 양성 가능성 높음 |
7.4.4 필터 조건 확인과 데이터셋 저장
Filtered Condition에서 현재 적용된 조건을 확인하고, 조건에 맞는 결과를 Save Dataset으로 저장할 수 있습니다. 저장된 데이터셋은 이후 분석 단계에서 재사용할 수 있습니다.