Q1. Reference set이란 무엇인가요?
Reference set은 IPA가 통계를 계산할 때 기준으로 삼는 "전체 유전자 집합(실험에서 검출될 수 있었던 유전자 전체)"입니다. Pathway 분석의 Ratio와 p-value(Fisher's exact test)는 모두 이 집합을 기준으로 계산됩니다.
Core Analysis에서 선택할 수 있는 Reference set은 다음과 같습니다.
QIAGEN은 실제 측정 가능했던 유전자 집합과 가장 가까운 전체 유전자 집합을 쓰는 것을 권장합니다. 따라서 대부분의 실험에서는 User Dataset 설정이 통계적으로 더 적절합니다.
Q2. Reference set을 User Dataset으로 설정하려면 어떻게 하나요?
Core Analysis 설정 화면의 General Settings에서 Reference set을 User Dataset으로 바꾸면 됩니다. 메뉴 이름과 위치는 IPA 버전에 따라 조금 다를 수 있습니다.
Q3. 같은 데이터셋인데 설정에 따라 결과가 왜 달라지나요?
Reference set이 바뀌면 Ratio의 분모와 p-value 계산의 기준이 함께 바뀌기 때문입니다.
Pathway의 Ratio는 다음과 같이 계산됩니다.
Knowledge Base를 쓰면 분모는 IPA가 정의한 pathway 구성원 전체입니다. User Dataset을 쓰면 그중 업로드한 데이터셋에 실제로 있는 분자만 분모에 남습니다. 분자는 두 설정에서 같습니다.
아래는 같은 데이터셋을 두 설정으로 분석한 Nucleosome assembly pathway 결과입니다.
항목 | Ingenuity Knowledge Base | User Dataset |
|---|---|---|
Ratio | 16/71 (0.225) | 16/39 (0.41) |
z-score | -2.5 | -2.5 |
p-value | 1.21E-06 | 1.97E-08 |
같은 16개 유전자가 겹쳐도, 측정 가능했던 39개 중 16개라는 비율이 더 높기 때문에 p-value가 더 유의해졌습니다. 이 변화는 pathway마다 다르게 일어나므로 pathway의 유의성 순위도 바뀔 수 있습니다. 반면 z-score는 겹치는 유저자들의 발현 방향으로 계산되므로 대개 그대로입니다.
Q4. Pathway 분자 중 일부가 분모에서 빠진 이유는 무엇인가요?
빠진 분자는 업로드한 데이터셋에 처음부터 없었던 유전자입니다. 측정되지 않았거나, 분석 전 처리 과정에서 제외된 경우입니다.
예를 들어 Nucleosome assembly처럼 히스톤 유전자가 많은 pathway는 RNA-seq에서 분자가 크게 줄어드는 경우가 많습니다.
어떤 유전자가 빠졌는지는 업로드한 원본 파일과 pathway 구성 유전자 목록을 비교해 확인할 수 있습니다.
Q5. User Dataset으로 설정할 때 반드시 확인해야 할 점은 무엇인가요?
업로드한 파일이 DEG만이 아니라, 실험에서 측정된 전체 유전자 목록이어야 합니다. User Dataset 설정은 이 전제에서만 올바른 결과를 줍니다.
유의한 유전자만 미리 걸러서 올린 파일을 Reference set으로 쓰면, 전체 유전자 집합이 "이미 유의한 유전자"로만 채워집니다. 이 경우 Fisher's exact test의 기준이 왜곡되어 p-value를 해석할 수 없게 됩니다. 이런 설정은 통계적으로 잘못된 것입니다.
올바른 방법은 다음과 같습니다.
이미 DEG만 담긴 파일밖에 없다면, 전체 유전자 목록으로 데이터셋을 다시 만들어 업로드한 뒤 분석하시기 바랍니다.