Q1. Reference set이란 무엇인가요?

Reference set은 IPA가 통계를 계산할 때 기준으로 삼는 "전체 유전자 집합(실험에서 검출될 수 있었던 유전자 전체)"입니다. Pathway 분석의 Ratio와 p-value(Fisher's exact test)는 모두 이 집합을 기준으로 계산됩니다.

Core Analysis에서 선택할 수 있는 Reference set은 다음과 같습니다.

QIAGEN은 실제 측정 가능했던 유전자 집합과 가장 가까운 전체 유전자 집합을 쓰는 것을 권장합니다. 따라서 대부분의 실험에서는 User Dataset 설정이 통계적으로 더 적절합니다.


Q2. Reference set을 User Dataset으로 설정하려면 어떻게 하나요?

Core Analysis 설정 화면의 General Settings에서 Reference set을 User Dataset으로 바꾸면 됩니다. 메뉴 이름과 위치는 IPA 버전에 따라 조금 다를 수 있습니다.

  1. 측정된 전체 유전자 목록이 담긴 데이터셋을 업로드 합니다. 유의한 유전자만 걸러낸 파일이 아니어야 합니다(Q5 참고). 
  2. 업로드한 데이터셋을 선택한 뒤 New Core Analysis를 시작하고, 사용할 측정값 컬럼(Expr Log Ratio, p-value, FDR 등)을 지정합니다.
  3. General Settings에서 Reference set(p-value 계산에 사용할 유전자 집합) 항목을 User Dataset으로 선택합니다.
  4. Cutoff 설정에서 분석에 포함할 유전자 기준(예: FDR < 0.05, |log2 fold change| > 1)을 지정합니다. 이 cutoff를 통과한 유전자만 분석 대상(analysis-ready molecules)이 되고, 업로드한 데이터셋이 전체 유전자 집합이 됩니다.
  5. 나머지 설정을 확인하고 분석을 실행합니다.


Q3. 같은 데이터셋인데 설정에 따라 결과가 왜 달라지나요?

Reference set이 바뀌면 Ratio의 분모와 p-value 계산의 기준이 함께 바뀌기 때문입니다.

Pathway의 Ratio는 다음과 같이 계산됩니다.

Knowledge Base를 쓰면 분모는 IPA가 정의한 pathway 구성원 전체입니다. User Dataset을 쓰면 그중 업로드한 데이터셋에 실제로 있는 분자만 분모에 남습니다. 분자는 두 설정에서 같습니다.

아래는 같은 데이터셋을 두 설정으로 분석한 Nucleosome assembly pathway 결과입니다.

항목

Ingenuity Knowledge Base

User Dataset

Ratio

16/71 (0.225)

16/39 (0.41)

z-score

-2.5

-2.5

p-value

1.21E-06

1.97E-08

같은 16개 유전자가 겹쳐도, 측정 가능했던 39개 중 16개라는 비율이 더 높기 때문에 p-value가 더 유의해졌습니다. 이 변화는 pathway마다 다르게 일어나므로 pathway의 유의성 순위도 바뀔 수 있습니다. 반면 z-score는 겹치는 유저자들의 발현 방향으로 계산되므로 대개 그대로입니다.


Q4. Pathway 분자 중 일부가 분모에서 빠진 이유는 무엇인가요?

빠진 분자는 업로드한 데이터셋에 처음부터 없었던 유전자입니다. 측정되지 않았거나, 분석 전 처리 과정에서 제외된 경우입니다.

예를 들어 Nucleosome assembly처럼 히스톤 유전자가 많은 pathway는 RNA-seq에서 분자가 크게 줄어드는 경우가 많습니다.

어떤 유전자가 빠졌는지는 업로드한 원본 파일과 pathway 구성 유전자 목록을 비교해 확인할 수 있습니다.


Q5. User Dataset으로 설정할 때 반드시 확인해야 할 점은 무엇인가요?

업로드한 파일이 DEG만이 아니라, 실험에서 측정된 전체 유전자 목록이어야 합니다. User Dataset 설정은 이 전제에서만 올바른 결과를 줍니다.

유의한 유전자만 미리 걸러서 올린 파일을 Reference set으로 쓰면, 전체 유전자 집합이 "이미 유의한 유전자"로만 채워집니다. 이 경우 Fisher's exact test의 기준이 왜곡되어 p-value를 해석할 수 없게 됩니다. 이런 설정은 통계적으로 잘못된 것입니다.

올바른 방법은 다음과 같습니다.

  1. 측정된 전체 유전자(예: 발현 필터를 통과한 모든 유전자)와 그 측정값(log ratio, p-value, FDR 등)을 업로드합니다.
  2. Reference set을 User Dataset으로 지정합니다.
  3. IPA의 cutoff 설정(FDR, log ratio 등)으로 분석할 유의 유전자를 걸러냅니다.

이미 DEG만 담긴 파일밖에 없다면, 전체 유전자 목록으로 데이터셋을 다시 만들어 업로드한 뒤 분석하시기 바랍니다.