<aside>
<img src="/icons/first-aid_gray.svg" alt="/icons/first-aid_gray.svg" width="40px" />
프로젝트 제목
- B-cell Linear Epitope 존재 여부 예측 모델 개발
</aside>
<aside>
<img src="/icons/first-aid_gray.svg" alt="/icons/first-aid_gray.svg" width="40px" />
팀 구성
- 팀명: 세포
- 팀장 : 장우석
- 팀원1 : 김재혁
- 팀원2: 윤우경
</aside>
<aside>
<img src="/icons/first-aid_gray.svg" alt="/icons/first-aid_gray.svg" width="40px" />
프로젝트 목표
- 프로젝트를 통해 해결하려는 질문이나 목표를 명확히 기술하세요.
- 실험 이전 단계에서 면역 반응 가능성이 높은 후보 서열을 선별하여 백신 및 항체 치료제 개발 과정의 시간과 비용을 줄이는 것
- 대시보드의 주요 기능 및 목표를 설정하세요.
- antigen, method, disease 제공 → start, end 입력 시 나오는 epitope가 P/N 확인
- biopython 활용 예정
<aside>
<img src="/icons/first-aid_gray.svg" alt="/icons/first-aid_gray.svg" width="40px" />
문제 정의
- 분석 및 시각화의 중점
- 프로젝트에서 해결하려는 핵심 질문을 1~2문장으로 작성하세요:
- 단백질 서열 정보와 제한적·불완전한 실험 라벨을 활용하여, 실험 이전 단계에서 특정 peptide 서열이 B-cell linear epitope를 포함할 가능성을 예측할 수 있을까?
- 또한, Weak Supervision 환경에서도 Protein Language Model이 epitope 관련 서열 패턴을 효과적으로 학습할 수 있는지를 검증하고자 한다.
- 문제의 필요성 및 중요성
- 프로젝트가 제공할 데이터 인사이트가 중요한 이유를 작성:
- B-cell epitope 검증은 비용과 시간이 많이 소요되는 실험 중심 과정으로, 모든 후보 서열을 실험적으로 검증하는 것은 현실적으로 어렵다.
- 따라서 Weak Supervision 기반 예측 모델을 통해 면역 반응 가능성이 높은 후보 서열을 사전에 선별할 수 있다면, 백신 및 항체 치료제 개발 과정의 효율성을 크게 향상시킬 수 있다.
</aside>
<aside>
<img src="/icons/first-aid_gray.svg" alt="/icons/first-aid_gray.svg" width="40px" />
데이터 활용 계획
- 데이터 출처
- 출처: 실험 논문 기반 B-cell epitope 데이터베이스 (큐레이션된 CSV 파일)
- 데이터 파일
train.csv (n = 190,811, label 제공)
test.csv (n = 120,944, label 미제공)
- 주요 변수
epitope_seq: 실험에 사용된 peptide 서열
antigen_seq: 항원 전체 단백질 서열
label: epitope 존재 여부 (0/1)
assay_method_technique, disease_type: 실험 및 질병 메타데이터
- 데이터 전처리 계획
- peptide 및 항원 서열 길이 분포 분석
- 실험 기법(
assay_method_technique)별 신뢰도 가중치 적용
- Protein Language Model 입력 형식에 맞춘 서열 토큰화
- label imbalance 및 noise를 고려한 학습 데이터 구성
- 대시보드 구성 계획
- epitope 예측 결과를 기반으로 후보 서열을 선별하고 모델 신뢰도를 분석하기 위한 연구·의사결정 지원용 대시보드
- 대시보드에 포함될 시각화 유형
- antigen structure, epitope, P/N 면역 반응 여부
- 주요 KPI 정의
- Epitope 후보 식별 성공률, 면역 반응 라벨 시각화 정확도 (예측 모델 정확도), 항원 구조-epitope 매핑 가시성, 조건별 분석 지원 범위 (i.e. antigen, method, disease 조합)
</aside>
<aside>
<img src="/icons/first-aid_gray.svg" alt="/icons/first-aid_gray.svg" width="40px" />
예상 결과물 및 기대 효과
- 대시보드 주요 구성
- 최종적으로 제작할 대시보드의 구성을 간략히 설명하세요.
- 항원 서열 정보와 면역 실험 데이터를 기반으로 사용자가 antigen, assay method, disease를 선택하고 서열 구간을 입력하면 해당 epitope가 항체와 면역 반응을 보일 가능성을 확인할 수 있는 대시보드를 구현
- 기대 효과
- 프로젝트 완료 후 얻게 될 데이터 인사이트와 활용 가능성을 제시하세요.
- 실험 이전 단계에서 면역 반응 가능성이 높은 epitope 후보를 신속히 선별하여 백신 및 항체 치료제 개발 초기 단계의 시간과 비용을 절감
- 항원 서열, 구조 정보, 면역 반응 결과를 통합적으로 제공함으로써 후보 항원 선별에 대한 연구자의 의사결정을 효율적으로 지원
- 조건별 분석을 통해 질환 및 실험 환경에 따른 면역 반응 특성을 파악할 수 있어 향후 다양한 항원 및 변이에 대한 확장 분석이 가능
</aside>
<aside>
<img src="/icons/first-aid_gray.svg" alt="/icons/first-aid_gray.svg" width="40px" />
프로젝트 일정 계획
1-2주차 : 프로젝트 기획
2-3주차 : 데이터 수집 및 전처리, 탐색적 데이터 분석 1
3-4주차 : 탐색적 데이터 분석 2, 중간 발표회
5-6주차 : 피드백 개선 & 자료 보완
6-7주차 : 프로젝트 고도화 & 최종 자료 제출
8주차 : 최종 제출 & 최종 발표
</aside>
<aside>
<img src="/icons/first-aid_gray.svg" alt="/icons/first-aid_gray.svg" width="40px" />
역할 분담
- 프로젝트 간 팀 내 역할 분담 계획
- EDA, 문제 정의 담당 : 김재혁, 윤우경, 장우석
- 대시보드 제작 및 디자인 담당 : 김재혁, 윤우경, 장우석
- 발표 준비 및 문서 작성 담당 : 김재혁, 윤우경, 장우석
</aside>