← Radar
PaperAI 요약

7,400만 단일세포 원천 시퀀스를 레퍼런스 없이 검색하는 플랫폼 Malva

· Nature
León-Periñán D, Karaiskos N, Rajewsky N
DOI: 10.1038/s41586-026-10975-w
요약

카운트 테이블에 묻힌 변이, 스플라이싱, 병원체 서열을 세포 단위에서 고속 탐색한다.

원문 보기 (Nature) →

단일세포 및 공간전사체 데이터가 페타바이트 규모로 쌓이고 있지만, 기존 파이프라인은 정렬 과정에서 유전자·이소폼 카운트만 남기고 원천 시퀀스 정보 대부분을 버린다. 이로 인해 공개 데이터 전체에서 특정 변이나 스플라이싱 접합부, 병원체 서열을 검색하려면 수백만 개의 원천 파일을 직접 다운로드해 재처리해야 했다. 연구진은 레퍼런스 유전체 없이 대규모 단일세포 원천 시퀀스 공간을 직접 탐색하는 인덱싱 플랫폼 Malva를 제안한다.

무엇을 했나

  • 종 구분과 레퍼런스 유전체 정렬 없이 원천 시퀀스를 고속 탐색하는 인덱스 구조인 Malva를 구축했다.
  • 건강 및 질환 상태의 수천 개 연구 데이터에서 수집한 약 7,400만 개 세포의 시퀀스 공간을 인덱싱했다.
  • 레퍼런스 정렬 없이 시퀀스 조성만으로 세포 유형을 분류하고 세포 간 유사도를 측정하는 분석 프로세스를 제시했다.
  • 임의의 염기서열, 변이, 스플라이싱 접합부, 병원체 서열 및 공간 위치 검색을 자동화하고 신경망 모델과 연동했다.

왜 눈여겨볼 만한가

공개 단일세포 데이터셋에서 카운트 매트릭스에 포함되지 않은 비정형 변이나 오염 병원체, 신규 스플라이싱 서열을 찾을 때 대용량 FASTQ를 매번 재처리하던 부담을 낮출 수 있다. 10x나 공간전사체 데이터 기반의 탐색적 연구에서 로컬 분석 전 서열 존재 여부를 빠르게 검증하는 스크리닝 도구로 활용도가 높아 보인다. 다만 자체 인덱스 데이터베이스의 업데이트 주기와 기존 정렬 파이프라인 대비 염기 단위 정밀도의 차이는 실제 사용 시 검증해 볼 필요가 있다.

원문

  • Nature · DOI 10.1038/s41586-026-10975-w