기술 백서 (Technical Whitepaper)

통합 단백질 공학 플랫폼™

유전자 합성에서 기능성 단백질까지, 단일 연속 워크플로우

설계(Design) · 예측(Predict) · 검증(Validate) · 합성(Synthesize)을 하나의 계산 파이프라인으로 통합한 in-silico 우선 단백질 엔지니어링 서비스

항목

내용

문서 등급

고객 배포용 (Customer-facing) / 대외비 아님

대상 독자

연구 책임자, 바이오텍 R&D 임원, 기술평가 심사역, 규제·CMC 담당자

적용 범위

효소 공학(Enzyme Engineering) de novo 단백질 설계 전 영역

작성 주체

바이오니아 바이오파운드리센터 합성생물학그룹

문의

geneorder@bioneer.co.kr





본 문서의 기술 서술 원칙

본 백서는 플랫폼을 소프트웨어 제품 단위로 구분하지 않고 하나의 통합 서비스로 기술합니다. 내부 계산 엔진은 모두 GC-계열 내부 모듈 코드명으로만 표기하며, 각 모듈은 입력·출력·불확실도 계약(contract)으로 정의된 교체 가능한 백엔드 구조를 갖습니다. 따라서 특정 백엔드의 교체 또는 자체 모델로의 이관이 고객 인터페이스와 산출물 형식에 영향을 주지 않습니다. 수치는 출처를 [내부 실측] / [문헌 기준] / [검증 필요]로 명시합니다.

목차

페이지 번호는 Word에서 목차를 선택한 뒤 F9(필드 업데이트)를 누르면 자동 갱신됩니다.



1. 개요 — 이 플랫폼이 해결하는 문제

2. 서비스 범위: 유전자 합성에서 단백질 합성까지의 연속성

3. 통합 플랫폼 아키텍처 — 17단계 단일 파이프라인

4. 내부 알고리즘 모듈 레퍼런스 (GC-Series)

5. 각 단계의 생물학적 의미 — 계산값은 무엇을 뜻하는가

6. 업계 표준 대비 성능 비교 평가

7. 신약 개발 관점의 적용 — Modality별 전략

8. 백신 개발 관점의 적용 — 항원 설계와 면역원성

9. 고객 관점 가이드 — 무엇을 주고, 무엇을 받는가

10. 논문·공개 데이터·상용 소프트웨어 요구사항 충족 매트릭스

11. 검증 체계, 품질관리, 재현성

12. 부록 — 용어집, 산출물 규격, 도입 체크리스트





1. 개요 — 이 플랫폼이 해결하는 문제

1.1 산업이 직면한 구조적 병목

단백질 의약품과 산업 효소 개발에서 가장 큰 비용은 합성 비용이 아니라 '실패한 합성'의 비용입니다. 유전자 합성 단가는 지난 15년간 극적으로 하락하여 유전자 하나를 물리적으로 만드는 일 자체는 더 이상 병목이 아닙니다. 병목은 '무엇을 합성할 것인가'를 결정하는 단계로 완전히 이동했습니다. 전형적인 효소 개량 프로젝트에서 연구팀은 수백 개의 변이체를 클로닝하고 발현시키고 정제한 뒤, 그중 활성이 개선된 것이 한 자릿수에 불과하다는 사실을 6개월 뒤에 확인합니다. 이 과정에서 소모되는 것은 시약비가 아니라 연구원의 시간과 프로젝트의 기회비용입니다.

문제의 근원은 서열-구조-기능 사상(mapping)의 비선형성입니다. 단일 아미노산 치환이 활성 부위에서 떨어진 위치에서 일어나더라도, 그 잔기가 기질 진입 채널의 유연성을 제어하는 힌지에 위치한다면 촉매 회전수(k_cat)를 한 자릿수 바꿀 수 있습니다. 반대로 활성 부위 바로 옆의 치환이 아무 효과도 내지 않는 경우도 흔합니다. 이 비직관성 때문에 합리적 설계(rational design)는 종종 무작위 변이(directed evolution)에 패배해 왔고, 무작위 변이는 탐색 공간이 20^N으로 폭발하기 때문에 실험적으로 커버 가능한 영역이 전체의 무한소에 불과합니다.

1.2 본 플랫폼의 접근

본 플랫폼은 '실험을 대체한다'고 주장하지 않습니다. 대신 '실험에 투입할 후보의 사전 확률(prior)을 계산적으로 재분배한다'는 훨씬 방어 가능한 목표를 설정합니다. 구체적으로, 무작위 선택 시 성공률이 1~3%인 후보군을, 계산 필터를 통과시킨 뒤 성공률 25~45% 수준의 농축된 후보군으로 변환하는 것이 목표이며, 이는 습식 실험 규모를 한 자릿수 줄이면서 동일한 기대 성과를 얻는다는 의미입니다.

핵심 설계 철학은 세 가지입니다. 첫째, 단일 예측 모델을 신뢰하지 않고 물리 기반·진화 기반·학습 기반 세 계열의 독립적 증거를 융합합니다. 둘째, 각 예측값에 불확실도를 부착하여 전파시키고, 불확실도가 큰 축은 자동으로 가중치가 낮아지도록 산술적으로 설계했습니다(임의의 if/else 임계값 대신 역분산 가중 융합). 셋째, 계산 비용이 낮은 필터를 앞에, 비싼 필터를 뒤에 배치하는 깔때기(funnel) 구조로 처리량과 정확도를 동시에 확보합니다.

핵심 메시지 3줄 요약

우리는 유전자 서열 설계부터 발현 가능한 단백질 후보 확정까지를 하나의 연속 파이프라인으로 제공하며, 고객은 중간에 서로 다른 소프트웨어를 오갈 필요가 없습니다.
② 17
단계 계산 깔때기가 10^4~10^5 규모의 초기 후보를 습식 실험 가능한 10~30개로 축소하며, 각 축소 단계는 생물학적으로 해석 가능한 근거를 산출물에 남깁니다.
모든 후보는 자유실시(FTO) 자동 사전 스크리닝, 면역원성 예측, 발현·용해도 예측을 거친 상태로 전달되므로 사업화 단계에서의 재작업 위험이 낮아집니다. FTO 스크리닝은 법률 의견을 대체하지 않으며, 정식 법률 검토는 별도로 필요합니다(4장 고지 참조).



1.3 정량적 요약

지표

본 플랫폼

일반적 산업 관행

근거 등급

초기 탐색 공간

10^4 ~ 10^5 설계

10^2 ~ 10^3 (실험 한계)

[내부 실측]

습식 실험 투입 후보 수

10 ~ 30

200 ~ 2,000

[내부 실측]

설계→후보확정 소요

2 ~ 6(계산)

4 ~ 9개월 (실험 반복)

[내부 실측]

후보당 평가 축(axis)

9 ~ 14

1 ~ 3(활성·발현 위주)

[내부 실측]

FTO 특허 회피 사전 검토

전 후보 자동 수행

법무 검토 단계에서 사후 발견

[내부 실측]

예측-실측 상관 (구조 품질)

ρ = 0.78 ~ 0.79

공개 벤치마크 0.6 ~ 0.8

[내부 실측/문헌 기준]

안정성 ΔΔG 예측 오차

1.0 ~ 1.5 kcal/mol (RMSE)

공개 도구 1.0 ~ 2.0

[문헌 기준]

재현성

동일 검증 환경에서 결정론적 재현

스크립트 의존, 부분 재현

[내부 실측]



1-1. 플랫폼 성능 요약. 근거 등급은 5장 및 6장에서 세부 전개됩니다.



2. 서비스 범위: 유전자 합성에서 단백질 합성까지의 연속성

2.1 '연속성'이 기술적으로 중요한가

많은 조직이 단백질 설계 도구와 유전자 합성 발주를 별개의 공정으로 운영합니다. 설계팀이 아미노산 서열을 결정하면, 그 서열을 별도 도구로 코돈 최적화하여 합성 업체에 발주하는 방식입니다. 이 분리는 겉보기에 합리적이지만 세 가지 정보 손실을 발생시킵니다.

첫째, 아미노산 수준에서 '동등하다'고 판단된 두 설계가 DNA 수준에서는 전혀 동등하지 않습니다. 특정 서열은 GC 함량 편중, 반복 서열, 헤어핀 구조 때문에 합성 자체가 실패하거나 단가가 급등합니다. 설계 단계에서 이를 모르면 '가장 좋은 후보가 합성 불가능'이라는 상황이 뒤늦게 드러납니다. 둘째, 코돈 사용 편향은 단순히 발현량만 좌우하는 것이 아니라 번역 속도 프로파일을 통해 공동번역 접힘(co-translational folding)에 영향을 줍니다. 희귀 코돈이 만드는 리보솜 일시정지(ribosome pausing)는 도메인 경계에서 접힘 시간을 확보해 주는 기능적 역할을 하며, 이를 무시한 '완전 최적화'는 오히려 봉입체(inclusion body) 형성을 늘릴 수 있습니다. 셋째, 발현 숙주의 선택은 번역후 수식(PTM), 이황화 결합 형성 능력, 샤페론 환경을 결정하므로 단백질 설계 단계에서 이미 고려되어야 합니다.

본 플랫폼은 이 세 층위 — 뉴클레오타이드, 번역 동역학, 접힌 단백질 — 를 하나의 목적함수 안에서 함께 다룹니다. 즉 단백질 설계 점수와 합성 가능성 점수가 동일한 후보 순위표에서 경쟁하며, 합성 불가능한 최적 설계는 애초에 상위에 오르지 않습니다.

2.2 서비스 경계 정의

단계

플랫폼 담당 범위

고객 담당 범위

산출물

1. 표적 정의

요구사항 정량화, 목적함수 설계 지원

생물학적 목표·성능 사양 제시

설계 사양서(Design Spec)

2. 서열 설계

전 계산 수행

제약 조건 검토·승인

후보 아미노산 서열 세트

3. 구조·기능 예측

전 계산 수행

-

구조 좌표, 결합/안정성/활성 예측표

4. 위험 검토

FTO, 면역원성, 발현성, 응집성 계산

법무·규제 최종 판단

위험 프로파일 리포트

5. 유전자 설계

코돈 최적화, 합성 가능성 검사, 벡터 설계

숙주·벡터 선호 지정

합성 발주용 DNA 서열

6. 유전자 합성

발주 사양 제공·검수 기준 제시

합성 업체 발주 또는 위탁

합성 QC 기준서

7. 단백질 발현·정제

조건 예측(온도, 유도, 태그, 샤페론) 제공

습식 실험 수행

발현 프로토콜 권고안

8. 기능 검증

예측-실측 대조 분석, 차기 라운드 재설계

assay 수행 및 데이터 제공

라운드 리포트 + 개선 설계



2-1. RACI 관점 서비스 경계. 플랫폼은 2~5단계를 완전 담당하며 6~8단계는 사양·기준 제공 역할입니다.

2.3 폐루프(Closed-loop) 운영

본 서비스의 실질적 가치는 단발성 설계가 아니라 라운드 반복에서 발생합니다. 1라운드 습식 데이터가 회수되면 그 데이터는 즉시 예측 모델의 보정(calibration)에 사용됩니다. 구체적으로 각 평가 축의 예측-실측 상관계수를 재추정하고, 상관이 낮게 나온 축의 가중치를 역분산 원리에 따라 자동으로 낮춥니다. 이것이 임의의 규칙을 추가하는 방식보다 우월한 이유는, 축의 신뢰도가 데이터에 의해 결정되고 사람의 편향이 개입하지 않기 때문입니다. 일반적으로 2라운드 이후 예측 정확도는 프로젝트별 표적 특이적 보정 덕분에 유의하게 상승하며, 3라운드에서 목표 사양 도달률이 가장 크게 개선됩니다.



3. 통합 플랫폼 아키텍처 — 17단계 단일 파이프라인

플랫폼은 두 가지 진입 모드를 지원합니다. 기존 단백질을 개량하는 '개량 모드'와 자연계에 존재하지 않는 골격을 새로 만드는 'de novo 모드'입니다. 두 모드는 초기 3단계만 다르고 이후 모든 평가·검증 단계를 공유합니다. 고객 입장에서는 하나의 서비스이며, 진입점만 표적의 성격에 따라 자동 결정됩니다.

3.1 단계 구성 개요

단계

명칭

핵심 질문

후보 수 변화

계산 비용

S0

골격 생성

이 기능을 담을 수 있는 3차원 골격은?

0 → 1,500

높음 (GPU)

S1

서열 설계

이 골격을 실제로 접히게 할 서열은?

1,500 → 30,000

중간 (GPU)

S1.5

자유실시·물성 사전 필터

특허 저촉 위험과 발현 불가 후보 제거

30,000 → 8,000

낮음 (CPU)

S1.8

저비용 사전선별

물리화학적으로 명백히 부적합한 후보 제거

8,000 → 1,200

매우 낮음

S2

구조 예측 (다중 시드)

예측 구조가 의도한 골격과 일치하는가?

1,200 → 1,200

매우 높음 (GPU)

S2.5

결합 파트너 매칭

표적/기질과의 결합 형상이 성립하는가?

1,200 → 600

높음

S3

구조 품질 게이트

활성 부위 기하가 촉매 가능 범위인가?

600 → 250

낮음

S3.5

3차원 구조 자유실시

구조적으로 기존 권리와 유사하지 않은가?

250 → 220

중간

S3.6

도킹 앙상블

리간드 결합 자세가 재현되는가?

220 → 180

높음

S4

분자동역학 검증

생리 조건에서 구조가 유지되는가?

180 → 60

매우 높음

S4.5

특이성·오프타깃 평가

의도하지 않은 표적에 작용하는가?

60 → 45

중간

S4.6

온타깃 효율 예측

의도한 표적에서 충분한 효율이 나오는가?

45 → 35

낮음

S4.7

자유에너지 섭동 계산

결합/안정성 변화의 정밀 정량값은?

35 → 20

극히 높음

S4.8

개발가능성 통합

제조·제형·규제 관점에서 문제는 없는가?

20 → 20

낮음

S5

양자화학 활성화 에너지

촉매 장벽이 실제로 낮아졌는가?

20 → 15

높음

S5.5

병원성·안전성 프록시

인체 단백질 유사성에 따른 위험은?

15 → 15

낮음

S6

유전자 설계 및 발주 사양

합성·발현 가능한 DNA?

15 → 10~15

낮음



3-1. 통합 파이프라인 단계 구성. 후보 수는 대표적 효소 개량 프로젝트 기준 실측 예시이며 프로젝트마다 달라집니다. [내부 실측]

그림 3-1. 후보 깔때기 구조. 각 단계는 앞 단계보다 후보당 계산 비용이 높으므로, 저비용 필터를 앞에 배치하여 비싼 계산이 소수 후보에만 도달하도록 설계되어 있습니다. 수치는 대표적 효소 개량 프로젝트 기준 예시입니다. [내부 실측]

3.2 깔때기 설계의 정보이론적 근거

깔때기 구조에서 가장 흔한 오해는 '초기 후보 수를 늘리면 최종 결과가 좋아진다'는 가정입니다. 이는 각 필터 단계의 판별력(선별 상관 ρ)이 충분히 높을 때만 참입니다. 필터의 ρ가 낮으면 초기 후보를 1,000개에서 10,000개로 늘려도 최종 선별된 집합의 품질은 거의 변하지 않습니다 — 필터가 사실상 무작위 추출과 다름없기 때문입니다. 내부적으로 이를 '상수 개수의 함정(constant-count trap)'이라 부르며, 실제 개발 과정에서 확인된 현상입니다.

따라서 본 플랫폼은 초기 규모 확대보다 필터 판별력 향상을 우선합니다. 대표적으로 서열 설계(S1) 이전에 구조적 사전선별을 삽입하여, 촉매 삼원체(catalytic triad)간 거리 RMS, 회전반경(Rg), 잔기 접촉 수 같은 기하학적 지표로 골격을 먼저 걸러냅니다. 이렇게 판별력을 확보한 뒤에야 초기 후보 수를 확대하는 순서를 따릅니다.

3.3 불확실도 전파 구조

각 계산 축은 점 추정값만이 아니라 표준오차를 함께 산출합니다. 예를 들어 구조 예측은 복수의 무작위 시드로 반복 수행되어 시드 간 분산을 신뢰도로 사용합니다. 단일 시드 예측은 우연히 좋은 값을 낼 수 있지만, 시드 간 편차가 큰 후보는 '예측이 불안정한 후보'로 분류되어 자동 감점됩니다. 이는 실무적으로 매우 중요한데, 예측 신뢰도가 낮은 후보를 높은 점수로 오인하여 습식 실험에 투입하는 것이 가장 비싼 오류이기 때문입니다.

축 간 융합은 역분산 가중(inverse-variance weighting)으로 이루어집니다. 분산이 큰 축은 자동으로 기여도가 낮아지므로, 어떤 축이 특정 프로젝트에서 신호를 주지 못하면 별도 조치 없이 영향력이 소멸합니다. 반대로 신뢰도 높은 축은 자연스럽게 순위를 지배합니다. 또한 실질성 게이트(materiality gate)를 두어, 한 축의 값이 후보 간 유의한 차이를 만들지 못하면 그 축은 순위 결정에서 제외됩니다. 이는 '변이 개수에 비례해 감점되는' 류의 가짜 신호가 순위를 오염시키는 것을 방지합니다.

왜 임계값(if/else)이 아니라 산술인가

많은 파이프라인이 '이 값이 0.7 이상이면 통과'와 같은 하드코딩 임계값을 누적시킵니다. 이 방식은 임계값이 늘어날수록 시스템 거동을 예측할 수 없게 되고, 데이터가 바뀌어도 임계값은 그대로 남아 침묵의 오류를 만듭니다. 본 플랫폼은 값의 불확실도와 출처가 모듈 경계를 넘어 보존되도록 설계했으며, 가중치는 규칙이 아니라 산술이 결정합니다. 이 원칙은 실제 운영 중 '노이즈에 순위가 매겨지던' 사례를 계약(contract) 기반 지문 검증과 역분산 융합으로 해결하면서 확립되었습니다.





4. 내부 알고리즘 모듈 레퍼런스 (GC-Series)

플랫폼의 계산 역량은 30개 내부 모듈로 구성됩니다(설계 생성 4, 구조·물리 7, 진화·학습 5, 위험·개발가능성 6, 표적 조절 2, 번역·모달리티 특이 6). 각 모듈은 기능 계약으로 정의되며, 내부 구현 백엔드는 성능 개선에 따라 교체될 수 있습니다. 고객 인터페이스와 산출물 규격은 백엔드 교체와 무관하게 유지되는 것이 설계 원칙입니다. 모든 모듈이 매 프로젝트에서 활성화되는 것은 아니며, 표적과 modality의 성격에 따라 필요한 모듈만 자동으로 켜집니다 (: 표적 조절 계열은 유전자 편집 프로젝트에서만, 번역·모달리티 특이 계열은 해당 modality가 선택될 때만).

4.1 설계 생성 계열

모듈

기능 계약

입력

출력

불확실도 표현

GC-SCAFFOLD

기능 모티프를 앵커로 3차원 주쇄 골격을 생성

촉매/결합 모티프 좌표, 길이 제약

주쇄 좌표 세트 (N)

모티프 RMSD, 생성 다양성 지수

GC-SEQDESIGN

주어진 주쇄를 접히게 하는 아미노산 서열 역설계

주쇄 좌표, 고정 잔기, 금지 잔기

서열 세트 + 위치별 확률

위치별 엔트로피, 서열 회수율

GC-LIBRARY

조합 변이 라이브러리 설계 및 위치 자동 발굴

야생형 서열, 변이 가능 위치

변이체 조합 세트

위치별 정보량

GC-GENE

아미노산→DNA 역번역, 코돈 최적화, 합성 가능성 평가

아미노산 서열, 숙주, 벡터

합성 발주용 DNA

합성 난이도 점수, 반복/헤어핀 플래그



4.2 구조·물리 예측 계열

모듈

기능 계약

생물학적 대응 개념

주요 지표

GC-FOLD

다중 시드 공동접힘 예측 (단백질 단독 및 리간드/핵산 복합체)

접힌 3차 구조, 복합체 형성

국소 신뢰도, 계면 신뢰도, 시드 간 표준오차

GC-MD

명시적 용매 분자동역학으로 구조 안정성 검증

생리 조건에서의 구조 유지, 유연성

RMSD 궤적, RMSF, 2차구조 보존율

GC-REMD

복제교환 분자동역학으로 열적 전이 온도 추정

열 안정성 (Tm)

전이 중점 온도, 신뢰구간

GC-FEP

연금술적 자유에너지 섭동으로 ΔΔG 정밀 계산

변이의 안정성/친화도 기여

ΔΔG (kcal/mol) + 수렴 오차

GC-QM

양자·기계학습 퍼텐셜 혼합으로 반응 장벽 추정

촉매 활성화 에너지 (Ea)

장벽 높이, 전이상태 기하

GC-DOCK

리간드 결합 자세 앙상블 생성 및 상호작용 분석

기질 결합 양식

결합 점수, 포즈 다양성, 접촉 잔기 목록

GC-FF

분자 역장 파라미터 자동 생성 (비표준 리간드 포함)

원자 수준 상호작용 기술

파라미터 품질 플래그



4.3 진화·학습 기반 계열

모듈

기능 계약

생물학적 대응 개념

주요 지표

GC-PLM

단백질 언어모델 기반 서열 자연스러움 평가

진화적으로 허용된 서열 공간에 속하는가

의사우도(pseudo-likelihood), 위치별 점수

GC-INVFOLD

구조 조건부 서열 우도 — 접힘 적합성 및 활성부위 프록시

이 구조에 이 서열이 얼마나 어울리는가

구조-조건부 log-likelihood

GC-COEVO

공진화 결합 분석으로 기능적 잔기쌍 식별

기능적으로 연결된 잔기 네트워크

직접 결합 강도(DI)

GC-STAB

안정성 변화(ΔΔG) 다중 모델 앙상블 예측

변이가 접힘 자유에너지에 미치는 영향

ΔΔG 예측치 + 모델 간 분산

GC-PATH

인체 단백질 맥락에서의 변이 병원성 프록시

안전성 위험 신호

병원성 확률



4.4 위험·개발가능성 계열

모듈

기능 계약

생물학적/사업적 대응 개념

주요 지표

GC-SIMSEARCH

서열 및 3차원 구조 유사도 검색 (자유실시 검토용)

기존 권리·선행기술과의 근접성

서열 동일성 %, 구조 유사도

GC-FTO

특허 청구항 대비 저촉 위험 평가 (조성물·방법 청구항 구분)

사업화 시 권리 충돌 위험

위험 등급, 저촉 청구항 목록

GC-IMMUNO

MHC 결합 예측 기반 면역원성 위험 평가

T세포 에피토프 밀도, 항약물항체 위험

에피토프 수, 대립유전자별 결합 강도

GC-SOL

용해도·응집성 예측

봉입체 형성 위험, 제형 안정성

용해도 점수, 응집 핫스팟 위치

GC-ELEC

정전기·이온화 상태 계산 (pKa 이동)

pH 의존적 활성/안정성

잔기별 pKa, 등전점

GC-DEVELOP

제조·제형·규제 관점 개발가능성 통합 점수

CMC 준비도

통합 개발가능성 점수 + 항목별 플래그



GC-FTO에 관한 필수 고지 — 법률 의견이 아닙니다

GC-FTO GC-SIMSEARCH가 산출하는 자유실시(FTO) 결과는 서열·구조 유사도와 공개 특허 문헌에 대한 **자동 사전 스크리닝(automated preliminary screening)**이며, 변리사 또는 변호사가 수행하는 FTO 의견서(freedom-to-operate opinion)가 아닙니다. 다음 한계가 명시적으로 존재합니다.
·
검색 대상은 확보된 공개 특허 코퍼스에 한정되며, 미공개 출원(통상 출원 후 18개월간 비공개), 일부 관할권 문서, 최신 등록 건은 누락될 수 있습니다.
·
청구항 해석은 법적 판단 영역이며, 균등론·심사경과 금반언·청구항 용어의 사전적 정의 등 실제 침해 판단에 결정적인 요소들은 자동 계산으로 대체될 수 없습니다.
·
유효성(validity), 존속기간, 권리 이전, 라이선스 이력은 평가 대상에 포함되지 않습니다.
따라서 본 결과의 용도는 (a) 설계 단계에서 고위험 후보를 조기에 회피하고, (b) 법률 검토에 투입할 대상을 좁혀 비용을 절감하는 데 있습니다. 사업화 의사결정 전에는 반드시 자격을 갖춘 법률 전문가의 정식 검토를 받아야 하며, 본 플랫폼과 그 제공자는 FTO 결과에 근거한 의사결정의 법적 결과에 대해 책임을 지지 않습니다.



4.5 표적 조절 계열 (핵산 표적 시스템 대응)

모듈

기능 계약

생물학적 대응 개념

주요 지표

GC-GUIDE

가이드 핵산 후보 발굴·설계 및 온타깃 효율 예측

표적 인식 서열의 활성

온타깃 효율 점수, R-loop 형성 에너지

GC-OFFTARGET

유전체 전역 오프타깃 부위 탐색 및 절단 확률 점수화

의도치 않은 부위 작용 위험

오프타깃 부위 수, 부위별 절단 점수



GC-GUIDE GC-OFFTARGET 계열은 유전자 편집 효소를 포함하는 프로젝트에서만 활성화됩니다. 일반적인 효소 개량이나 항원 설계 프로젝트에서는 비활성 상태로 유지되며 계산 비용을 소모하지 않습니다.

4.6 번역·모달리티 특이 계열

앞의 다섯 계열이 모든 단백질 프로젝트에서 재사용되는 범용 엔진이라면, 이 계열은 특정 modality를 선택했을 때만 활성화되는 번역(translational) 단계 모듈입니다. 이들은 후보를 새로 생성하지 않고, 이미 생성·검증된 후보에 대해 해당 modality 고유의 개발가능성·약동학·규제 축을 추가로 평가합니다. 따라서 대부분 분석·평가 전용이며, 생성 파이프라인을 가진 상위 계열과 구분됩니다.

모듈

기능 계약

적용 modality

주요 지표

GC-KCAT

서열×기질로부터 촉매 회전수(k_cat/K_M) 상대 예측

효소치료제, 산업효소, 핵산 합성효소

상대 k_cat 순위, 모델 신뢰도

GC-FIDELITY

핵산 합성효소의 복제/전사 충실도 지수(염기 선택·교정 기하·활성화 장벽 합의)

중합효소, 역전사효소, RNA 중합효소, TdT

충실도 지수(오류율 프록시), 축별 분산

GC-TERNARY

표적 분해제 3원 복합체 협동성 및 링커 기하 평가

표적단백질분해제(PROTAC/분자접착제)

협동성 α, 링커 적합도, DC50 프록시

GC-FORMAT

다중특이·접합 포맷 공학: 사슬쌍 정확도 및 접합비(DAR)/링커 개발가능성

이중·다중특이항체, 항체-약물 접합체(ADC)

오조립 위험, DAR 최적성, 소수성 부하

GC-PK

약동학·노출 프록시: 청소율·반감기·점도·PBPK 조직 노출

전 생물의약품 modality

예측 반감기 구간, 점도 플래그, 조직 노출비

GC-UQ

불확실도 정량화·규제 신뢰도: 등각예측 구간, 적용가능영역, 모델 신뢰도 등급

modality (교차 적용)

예측구간(coverage), 도메인 내/외 판정, 신뢰도 등급



이 계열의 성숙도에 관한 정직한 고지

GC-KCATGC-FIDELITY는 후보 간 상대 순위에서 신뢰할 만하지만 절대값(절대 k_cat, 절대 오류율)을 산출하지 않습니다 — 이는 6.6절에 기술된 분야 전반의 한계입니다. GC-TERNARY·GC-FORMAT은 현재 생성 파이프라인 없이 공급된 설계에 대한 개발가능성 평가·게이트로 동작하며(분석 전용), 후보 자체의 3차원 생성은 상위 계열(GC-SCAFFOLD )이 담당합니다. GC-UQ의 등각예측 구간은 보정 데이터가 충분한 축에서만 유효하며, 데이터가 부족한 신규 표적에서는 '적용가능영역 밖(out-of-domain)'으로 정직하게 표시됩니다.



모듈 교체 가능성에 대한 고객 보증

GC 모듈은 백엔드 독립적 계약으로 정의되어 있으므로, 내부 엔진이 자체 개발 모델로 이관되거나 성능이 개선된 대체 엔진으로 교체되더라도 (a) 산출물 파일 형식, (b) 점수 스케일 정의, (c) 리포트 구조는 변경되지 않습니다. 백엔드 변경 시에는 동일 입력에 대한 회귀 검증 결과를 고객에게 함께 제공하여 이전 라운드와의 비교 가능성을 보장합니다.





5. 각 단계의 생물학적 의미 — 계산값은 무엇을 뜻하는가

이 장은 본 백서에서 가장 중요한 부분입니다. 계산 점수는 그 자체로 의미가 없으며, 어떤 생물학적 현상의 대리 지표(proxy)인지를 명확히 할 때만 의사결정에 사용할 수 있습니다. 각 절은 '무엇을 계산하는가 → 생물학적으로 무엇을 뜻하는가 → 어떻게 틀릴 수 있는가' 순서로 기술합니다.

5.1 골격 생성 — 기능은 형태에 선행하는가

de novo 설계의 출발점은 '이 화학 반응을 촉매하려면 어떤 원자들이 공간 어디에 있어야 하는가'라는 질문입니다. 세린 가수분해효소를 예로 들면, Ser-His-Asp 촉매 삼원체는 특정한 기하 배치를 요구합니다. SerHisNε2 사이 거리는 수소결합이 성립하는 2.6~3.2Å 범위여야 하고, HisNδ1Asp 카복실기와 유사한 거리에 있어야 하며, 세 원자가 이루는 각도 역시 좁은 허용 범위를 갖습니다. 이 배치가 성립하면 His가 일반 염기로 작용해 Ser의 양성자를 뽑아내고, 활성화된 알콕사이드가 기질 카보닐 탄소를 친핵 공격하는 전형적 메커니즘이 가능해집니다.

GC-SCAFFOLD가 하는 일은 이 기하 구속조건을 만족시키면서 나머지 단백질 주쇄를 '그럴듯하게' 채워 넣는 것입니다. 생물학적으로 이는 자연 진화가 수억 년에 걸쳐 탐색한 접힘 공간을 계산적으로 재탐색하는 행위이며, 중요한 통찰은 동일한 촉매 기하를 지지할 수 있는 접힘은 하나가 아니라는 점입니다. 실제로 세린 가수분해효소 활성은 α/β-hydrolase 접힘, 키모트립신 접힘, 서브틸리신 접힘 등 진화적으로 무관한 여러 골격에서 독립적으로 출현했습니다(수렴 진화). 이 사실이 de novo 설계의 이론적 근거입니다 — 기능을 담는 형태는 유일하지 않으므로, 자연이 찾지 못한 형태도 존재할 수 있습니다.

실패 양상: 모티프 기하가 정확히 재현되었더라도 그 주변 잔기들이 만드는 정전기 환경이 잘못되면 촉매는 작동하지 않습니다. HispKa가 잔기 환경에 따라 4에서 9까지 이동할 수 있는데, 생리 pH에서 염기로 작동하려면 pKa6~7 부근이어야 합니다. GC-ELEC이 이 pKa 이동을 계산하여 기하만 맞고 화학은 틀린 설계를 걸러내는 역할을 합니다.

5.2 서열 설계 — 접힘 코드의 역방향 해독

주쇄 좌표가 주어졌을 때 어떤 아미노산 서열이 그 구조로 접힐 것인가를 묻는 문제를 역접힘(inverse folding)이라 합니다. 이는 정접힘보다 근본적으로 쉬운데, 하나의 구조를 만족시키는 서열은 매우 많기 때문입니다. 생물학적 근거는 자연 단백질에서 서열 동일성이 30% 미만인 단백질들이 거의 동일한 접힘을 갖는 현상이 흔하다는 점입니다.

GC-SEQDESIGN은 각 위치의 국소 화학 환경 — 용매 노출도, 이웃 잔기, 주쇄 이면각 — 을 조건으로 아미노산 확률 분포를 산출합니다. 생물학적으로 이 분포는 '진화가 이 위치에서 허용했을 법한 잔기들'에 해당합니다. 소수성 코어 위치에서는 Leu/Ile/Val/Phe에 확률이 집중되고, 표면 노출 위치에서는 Glu/Lys/Gln 등 극성 잔기가 우세하며, 이 패턴은 실제 단백질의 소수성 분포와 일치합니다.

실무상 중요한 제어 지점이 둘 있습니다. 첫째, 시스테인 배제입니다. 설계 서열에 의도치 않은 Cys가 들어가면 잘못된 이황화 결합이 형성되어 응집이나 오접힘을 유발하고, 특히 세포질 발현에서는 환원 환경 때문에 결합이 형성되지 않아 유리 티올이 남아 장기 보관 안정성을 해칩니다. 따라서 Cys는 명시적으로 설계 의도가 있을 때만 허용하며, 사후 제거가 아니라 생성 단계에서 금지해야 합니다. 둘째, 야생형 회귀 방지입니다. 역설계 모델은 종종 원본 서열을 그대로 재현하는 경향이 있는데, 이는 벤치마크에서는 좋은 지표지만 신규 설계 목적에서는 실패입니다. 설계 다양성을 강제하는 온도 파라미터 제어와 원본 대비 동일성 상한 필터가 필요합니다.

생물학적 함정: '통계적으로 좋은 서열' ≠ '발현되는 서열'

역설계 모델은 구조적 적합성만 최적화하므로, 번역·접힘 동역학·샤페론 의존성·프로테아제 감수성 같은 세포 내 현실을 모릅니다. 실제로 계산상 완벽한 설계가 대장균에서 전혀 발현되지 않는 경우가 흔하며, 원인은 대개 (a) N-말단 서열의 번역 개시 저해, (b) 소수성 패치에 의한 봉입체 형성, (c) 희귀 코돈 클러스터입니다. 본 플랫폼이 GC-SOL, GC-GENE을 동일 순위표에 포함시키는 이유가 이것입니다.



5.3 구조 예측 — 신뢰도 지표의 생물학적 해석

구조 예측 모델은 좌표와 함께 신뢰도 지표를 산출합니다. 국소 신뢰도가 높은 영역은 모델이 확신하는 잘 정의된 구조를 뜻하며, 낮은 영역은 두 가지 서로 다른 의미를 가질 수 있습니다. 하나는 모델의 무지(정보 부족)이고, 다른 하나는 실제로 그 영역이 본질적 무질서(intrinsically disordered)라는 생물학적 사실입니다. 이 둘을 구별하는 것이 해석의 핵심입니다.

구별 방법은 서열 기반 무질서 예측과의 대조입니다. 서열 조성이 전형적 무질서 특징 (낮은 소수성, 높은 순전하, Pro/Gly/Ser 풍부)을 보이면서 국소 신뢰도가 낮으면 이는 실제 무질서일 가능성이 높고, 설계 결함이 아닙니다. 오히려 링커나 유연한 루프로서 기능적 역할을 할 수 있습니다. 반면 소수성 조성인데 신뢰도가 낮다면 이는 설계 실패 신호입니다 — 소수성 잔기가 안정한 위치를 찾지 못했다는 뜻이며 응집 위험을 시사합니다.

복합체 예측의 계면 신뢰도는 별도 해석이 필요합니다. 이 값은 모델이 예측한 접촉면 기하에 대해 모델 자신이 부여하는 확신도이며, 결합 특이성이나 결합 친화도(Kd)의 척도가 아닙니다. 이 셋을 동일시하는 것은 흔하지만 부정확한 해석입니다. 고친화도 결합이 반드시 높은 계면 신뢰도를 주지 않고, 높은 계면 신뢰도가 결합의 존재를 증명하지도 않습니다 — 모델이 확신을 가지고 틀릴 수 있기 때문입니다.

따라서 올바른 용법은 다음과 같습니다. 계면 신뢰도는 이분법적 판정 기준이 아니라 **분류(triage) 지표**로 사용합니다. 낮은 값은 '이 결합 가설은 구조적 근거가 약하므로 추가 검증 없이는 진행하지 않는다'는 우선순위 하향 신호이고, 높은 값은 '물리 기반 검증(GC-DOCK, GC-MD, GC-FEP)에 투입할 가치가 있다'는 신호일 뿐 결론이 아닙니다. 친화도에 대한 정량 주장은 GC-FEP 결과와 실측 데이터에 근거해야 하며, 계면 신뢰도만으로 친화도나 특이성을 주장하지 않습니다.

다중 시드 전략의 근거와 그 해석 범위: 단일 시드 예측은 우연히 좋은 값을 낼 수 있으므로, 무작위 시드를 달리한 반복 예측의 편차를 신뢰도 추정에 사용합니다. 여기서 중요한 것은 이 편차가 무엇의 척도인가입니다 — 이는 **모델 불확실성(model uncertainty)**의 척도이며, 물리적으로 샘플링된 형태 앙상블이 아닙니다. 두 개념을 동일시하는 해석은 부정확합니다. 시드 간 편차가 큰 영역이 실제로 유연한 영역과 일치하는 경우가 관찰되기는 하나, 이는 상관이지 등가가 아니며, 학습 데이터 부족이나 모델 한계로도 동일한 편차가 발생합니다. 실제 형태 앙상블이 필요한 경우에는 GC-MD 또는 향상 샘플링을 통한 물리 기반 샘플링을 별도로 수행해야 합니다.

5.4 안정성 예측 — ΔΔG가 실험실에서 뜻하는 것

부호 규약 정의: 본 문서 전반에서 ΔΔG ≡ ΔG_variant − ΔG_WT (접힘 자유에너지 기준)로 정의하며, 따라서 음수는 안정화, 양수는 불안정화를 뜻합니다. 이 규약은 도구마다 반대로 정의되는 경우가 있으므로 타 문헌이나 타 도구 출력과 대조할 때 반드시 확인해야 합니다. 본 플랫폼 산출물에는 각 ΔΔG 컬럼에 사용된 부호 규약이 메타데이터로 명시됩니다.

ΔΔG를 융해온도(Tm) 변화로 환산하려는 요구가 자주 있으나, 고정 환산계수는 존재하지 않습니다. 두 양의 관계는 해당 단백질의 전개 엔탈피(ΔH_unfold)와 열용량 변화(ΔCp)에 의존하며, 이 값들은 단백질마다 크게 다르고 동일 단백질에서도 조건에 따라 변합니다. 따라서 'ΔΔG 1 kcal/mol = Tm ○°C'와 같은 일반 환산은 본 문서에서 제시하지 않습니다. 고객 표적에 대해 열역학 파라미터가 실험적으로 확보된 경우에 한하여 해당 표적 전용 환산식을 산출하며, 그렇지 않은 경우 ΔΔG는 후보 간 상대 순위 지표로만 사용합니다.

그러나 안정성과 활성 사이에는 잘 알려진 상충 관계가 존재합니다. 효소 활성 부위는 대개 열역학적으로 불리한 배치를 취하고 있습니다 — 하전 잔기가 소수성 환경에 묻혀 있거나, 변형된 이면각을 갖거나, 밀집된 극성 네트워크를 이룹니다. '전략적 불안정성'이 기질 결합과 전이상태 안정화에 필요한 에너지를 제공하기 때문입니다. 따라서 활성 부위 주변을 무분별하게 안정화하면 활성이 소실됩니다.

본 플랫폼은 이 상충을 명시적으로 다룹니다. 안정화 변이 후보는 활성 부위로부터의 거리, 기질 접근 경로와의 중첩, 촉매 잔기와의 공진화 결합 강도를 기준으로 층화됩니다. 활성 부위에서 충분히 멀고 공진화 신호가 약한 위치의 안정화 변이만이 '안전한 안정화'로 분류되어 우선 채택됩니다. 이는 주변부 안정화(peripheral stabilization) 전략에 해당하며, 산업 효소 개량에서 실증된 접근입니다.

5.5 분자동역학 — 정적 구조가 놓치는 것

구조 예측이 산출하는 것은 하나의 정적 좌표 집합이지만, 단백질의 기능은 대부분 동적입니다. 기질이 활성 부위로 진입하려면 게이트 잔기가 열려야 하고, 생성물이 방출되려면 다른 형태 전이가 필요하며, 알로스테릭 조절은 정의상 원거리 동적 커플링입니다. GC-MD는 명시적 물 분자와 이온을 포함한 환경에서 뉴턴 운동방정식을 수치 적분하여 이 동역학을 샘플링합니다.

해석 지표와 생물학적 의미는 다음과 같습니다. 주쇄 RMSD 궤적이 초기 상승 후 평탄역에 도달하면 구조가 안정한 국소 최소점에 정착했다는 뜻이며, 계속 상승하면 접힘이 풀리고 있다는 신호입니다. 잔기별 RMSF는 유연성 프로파일을 주는데, 활성 부위 잔기가 과도하게 유연하면 촉매 기하가 유지되지 않아 활성이 낮을 것으로 예상됩니다. 2차구조 보존율은 설계된 α-나선과 β-시트가 실제로 유지되는지를 보여주며, 설계 단계에서 의도한 토폴로지가 물리적으로 자기 일관적인지 판단하는 최종 관문입니다.

한계를 정직하게 밝히면, 일반적인 수십~수백 나노초 시뮬레이션은 단백질의 실제 기능적 전이 시간척도(마이크로초~밀리초)보다 훨씬 짧습니다. 따라서 MD'이 구조가 무너지지 않는다'를 확인하는 음성 필터로는 강력하지만, '이 구조가 기능한다'를 증명하지는 못합니다. 이 구별을 흐리는 주장은 과학적으로 방어할 수 없으며, 본 플랫폼은 MD 결과를 배제 필터로만 사용합니다.

5.6 자유에너지 섭동 — 가장 비싸고 가장 정확한 축

GC-FEP는 야생형과 변이체 사이를 비물리적 중간 상태를 거쳐 연속적으로 변환시키면서 각 구간의 에너지 변화를 적분하여 ΔΔG를 계산합니다. 이는 통계역학적으로 엄밀한 방법이며, 충분히 수렴하면 실험값과 1 kcal/mol 이내로 일치하는 것이 보고되어 있습니다. 대가는 계산 비용으로, 변이 하나당 수 시간에서 수십 시간의 GPU 시간이 필요합니다.

따라서 FEP는 깔때기 최말단에 배치되어 최종 후보 20~35개에만 적용됩니다. 생물학적으로 이 단계가 답하는 질문은 '이 변이가 정말로 결합을 강화하는가, 아니면 앞선 근사 모델의 인공물인가'입니다.

앞 단계 점수와 FEP 결과가 어긋나는 경우가 실제로 발생합니다. 이때 FEP를 무조건 우선하지는 않습니다. FEP 결과에 높은 신뢰를 부여하는 것은 다음 전제조건이 모두 충족될 때에 한합니다: (a) 출발 결합 포즈가 실험 구조 또는 독립적 도킹·MD 근거로 뒷받침될 것, (b) 이온화 상태(protonation state)가 해당 pH에서 명시적으로 결정되었을 것, (c) 리간드 역장 파라미터가 검증되었을 것, (d) 전방/후방 계산 히스테리시스가 허용 범위 이내이고 λ 구간 중첩이 충분할 것, (e) 열역학적 순환 폐쇄(cycle closure) 오차가 기준 이내일 것. 이 중 하나라도 미충족이면 FEP 값은 참고치로 강등되며, 그 사실이 산출물에 플래그로 기록됩니다. FEP'가장 정확할 수 있는 축'이지 '항상 옳은 축'이 아닙니다.

5.7 면역원성 — 치료용 단백질의 최대 실패 요인

치료용 단백질에서 임상 실패의 상당 부분은 효능 부족이 아니라 항약물항체(ADA) 형성에서 비롯됩니다. 기전은 다음과 같습니다. 투여된 단백질이 항원제시세포에 흡수되어 리소좀에서 분해되고, 생성된 펩타이드 조각이 MHC class II에 적재되어 표면에 제시되면, CD4+ T세포가 이를 인식하여 B세포 도움을 제공하고 결국 중화항체가 만들어집니다. 항체가 생기면 약물이 급속히 제거되거나 활성이 중화되며, 심한 경우 내인성 단백질과의 교차반응으로 안전성 문제가 발생합니다.

GC-IMMUNO는 설계 서열 전체를 훑으며 MHC class II 대립유전자별 결합 강도를 예측하여 T세포 에피토프 지도를 만듭니다. 기술적으로 정확히 하면, MHC class II 결합홈은 양 끝이 열려 있어 통상 13~25개 잔기 길이의 펩타이드가 적재되며, 결합 친화도를 실제로 결정하는 것은 그 안에 자리잡는 9개 잔기의 결합 코어(binding core)입니다. 따라서 예측은 13~25-mer 펩타이드 창에 대해 수행하되 그 안에서 결합 코어 위치를 함께 추정하며, 코어 바깥의 측면 잔기(flanking residue)가 친화도에 기여하는 부분도 반영됩니다. 생물학적 해석에서 중요한 점은 에피토프의 절대 개수보다 '외래성(foreignness)'입니다. 인체 단백질에 존재하는 서열과 동일한 에피토프는 중추 관용(central tolerance)에 의해 대개 무시되는 반면, de novo 설계 단백질처럼 인체 프로테옴에 존재하지 않는 서열은 관용 대상이 아니므로 위험이 높습니다. 따라서 de novo 설계는 개량 설계보다 본질적으로 면역원성 위험이 큽니다.

완화 전략도 계산적으로 지원됩니다. 에피토프 핫스팟이 식별되면 그 위치에서 MHC 결합을 약화시키면서 구조·기능은 보존하는 치환을 탐색합니다(탈면역화, deimmunization). 이때 GC-STABGC-FOLD를 함께 사용해 탈면역화 변이가 안정성이나 활성을 해치지 않는지 동시에 확인합니다. 단독 최적화로는 반드시 다른 축을 희생시키기 때문입니다.

해석 한계: MHC 결합 예측은 ADA 위험을 정량하지 않는다

MHC class II 결합 예측은 면역원성 연쇄의 한 단계만을 다룹니다. 실제 항약물항체(ADA) 발생은 항원 처리·제시 효율, 개인별 HLA 유전형 분포, T세포 수용체(TCR) 레퍼토리, 조절 T세포에 의한 관용, 투여 경로·용량·빈도, 환자의 면역 상태, 그리고 제형 인자 (특히 응집체 함량과 불순물)에 함께 의존합니다. 따라서 본 플랫폼의 에피토프 점수는 'ADA 발생률 예측치'가 아니라 '후보 간 상대적 면역원성 위험 순위'로만 해석해야 합니다. 절대 위험 판단에는 시험관 내 T세포 증식 assay, HLA 다양성 코호트 시험, 그리고 임상 면역원성 평가가 필요하며, 계산 결과는 이들 시험의 설계 우선순위를 정하는 용도로 사용됩니다.



5.8 용해도와 응집 — 제조 가능성의 물리적 근거

단백질 응집은 부분적으로 풀린 중간체가 노출된 소수성 표면을 통해 서로 결합하면서 시작됩니다. 일단 핵이 형성되면 성장은 자가촉매적으로 가속되며, 응집체는 면역원성을 크게 높이는 것으로 알려져 있어 규제 관점에서도 핵심 관리 항목입니다.

GC-SOL은 서열과 구조에서 응집 경향 핫스팟을 예측합니다. 물리적 근거는 응집 유발 서열이 특징적 조성을 갖는다는 점입니다 — 연속된 소수성 잔기, β-시트 형성 경향, 낮은 순전하가 결합된 구간이 위험합니다. 반대로 하전 잔기는 정전기 반발로 응집을 억제하므로 '전하 게이트키퍼'로 기능합니다. 계산 결과는 두 가지 실무 조치로 이어집니다. 첫째, 핫스팟이 표면에 노출되어 있으면 하전 잔기 도입으로 완화합니다. 둘째, 핫스팟이 구조적으로 필수적이면 서열 변경 대신 제형(pH, 이온강도, 계면활성제)으로 대응하도록 권고합니다. 등전점이 제형 pH에 근접하면 순전하가 0에 가까워져 응집이 급증하므로, GC-ELEC이 계산한 등전점과 목표 제형 pH의 간격을 최소 1.5 단위 이상 확보하도록 설계 단계에서 조정합니다.

5.9 코돈 최적화 — 번역 동역학의 생물학

동일한 아미노산 서열을 만드는 DNA 서열은 무수히 많으며, 그 선택이 발현량을 수십 배 좌우합니다. 단순한 관점은 '숙주에서 가장 흔한 코돈을 쓰라'는 것이지만, 이는 부분적으로만 옳습니다.

정교한 관점은 다음과 같습니다. 첫째, 5' 말단 약 30~50 코돈 구간은 오히려 희귀 코돈과 약한 mRNA 2차구조가 유리합니다. 이 구간의 강한 헤어핀은 리보솜 진입을 물리적으로 방해하여 개시 효율을 떨어뜨리기 때문이며, 실제로 대장균 유전자들에서 5' 말단의 코돈 사용이 전체 평균보다 덜 최적화되어 있다는 관찰이 있습니다. 둘째, 도메인 경계에 위치한 완만한 번역 감속은 공동번역 접힘에 유익할 수 있습니다. 신생 사슬이 리보솜 출구 터널을 빠져나온 뒤 다음 도메인이 합성되기 전에 접힐 시간을 벌어주기 때문입니다. 셋째, tRNA 풀은 성장 조건에 따라 변하므로 유도 조건과 배지가 최적 코돈 선택에 영향을 줍니다.

GC-GENE은 이 요소들을 함께 다루면서 동시에 합성 실현 가능성을 검사합니다. 구체적으로 GC 함량이 국소적으로 30~70% 범위를 벗어나는 구간, 8bp 이상의 직접반복, 제한효소 인식 부위, 강한 헤어핀(ΔG 임계 이하), 동일 염기 6회 이상 반복을 플래그하며, 이들은 합성 실패나 단가 상승의 주원인입니다. 이 검사가 설계 단계에 통합되어 있으므로 '합성 불가 판정으로 인한 재설계'가 구조적으로 발생하지 않습니다.



6. 업계 표준 대비 성능 비교 평가

이 장은 본 플랫폼을 업계에서 통용되는 기준선과 비교합니다. 비교는 세 층위에서 수행됩니다: (a) 개별 예측 축의 정확도, (b) 파이프라인 수준의 농축 효율, (c) 운영·규제 관점의 성숙도. 공정성을 위해 본 플랫폼이 열위인 항목도 명시합니다.

본 장의 증거 등급에 관한 고지 — 먼저 읽어 주십시오

본 장의 수치는 세 가지 성격이 섞여 있으며, 독자가 이를 구분할 수 있도록 각 표에 등급을 표기했습니다.
① [
내부 실측] — 본 플랫폼 실행 로그와 회귀 스위트에서 직접 측정된 값. 검증 가능.
② [
문헌 통상범위] — 해당 분야에서 통상적으로 보고되는 범위를 서술한 것으로, 특정 논문의 단일 수치를 인용한 것이 아닙니다. 현재 본 문서에는 번호 인용과 참고문헌 목록이 부착되어 있지 않으므로, 이 등급의 수치는 독자가 독립적으로 검증할 수 없습니다. 따라서 조달 심사나 규제 제출에 인용하기 전 반드시 원출처 확인이 필요하며, 요청 시 인용이 부착된 별도 부속서를 제공합니다.
③ [
내부 관측·미감사] — 내부 프로젝트에서 관측된 경향이나, 프로젝트 수·표본 수·assay 정의·신뢰구간이 표준화된 형태로 집계되지 않은 값. 공식 성능 보증의 근거로 사용할 수 없으며 방향성 참고치입니다.



6.1 비교 기준선 정의

기준선

성격

대표적 특징

비교 목적

기준선 A — 전통적 실험 중심

무작위 변이 + 스크리닝

계산 최소, 대규모 습식 실험

시간·비용 절감 효과 측정

기준선 B — 단일 도구 기반 합리적 설계

구조 예측 1+ 육안 검토

널리 쓰이는 관행

다축 평가의 부가가치 측정

기준선 C — 상용 통합 스위트

라이선스형 분자모델링 패키지

GUI 중심, 물리 기반 강점

기능 커버리지 비교

기준선 D — 공개 학술 파이프라인

논문 부속 코드 조합

최신 방법론, 운영 성숙도 낮음

정확도 상한 비교



6.2 개별 예측 축 정확도 비교

평가 축

본 플랫폼

공개 도구 통상 범위

상용 스위트 통상 범위

비교 상태

단량체 구조 정확도

고신뢰 영역 90+ 수준 [내부]

85 ~ 95 [문헌 통상범위]

물리기반 단독 시 낮음

동일 데이터셋 직접 비교 미실시

복합체 계면 예측 성공률

다중 시드 합의 사용 [내부]

30 ~ 60% [문헌 통상범위]

도킹 의존, 20 ~ 50%

동일 데이터셋 직접 비교 미실시

안정성 ΔΔG (RMSE, kcal/mol)

1.0 ~ 1.5 (앙상블) [내부]

1.0 ~ 2.0 [문헌 통상범위]

1.2 ~ 2.0

동일 데이터셋 직접 비교 미실시

결합 친화도 ΔΔG (FEP 수렴 시)

1 kcal/mol 이내 (전제조건 충족 시)

미지원 다수

1 ~ 1.5

동일 데이터셋 직접 비교 미실시

용해도/응집 예측 (AUC)

0.70 ~ 0.80 [내부]

0.65 ~ 0.80 [문헌 통상범위]

0.65 ~ 0.75

동일 데이터셋 직접 비교 미실시

면역원성 에피토프 예측 (AUC)

0.80 ~ 0.90 (대립유전자 의존)

0.80 ~ 0.90 [문헌 통상범위]

제한적 지원

동일 데이터셋 직접 비교 미실시

가이드 효율 예측 (Spearman ρ)

ρ = 0.78 ~ 0.79 [내부 실측]

ρ = 0.4 ~ 0.7 [문헌 통상범위]

미지원

내부 검증셋 기준 — 외부 재현 예정

활성화 에너지 정성 순위

정성적 순위만 사용

미지원

QM 모듈 보유 시 유사

정량 비교 불가 (정성 지표)



6-1. 축별 정확도 비교. 공개 도구/상용 스위트 범위는 해당 분야 벤치마크 문헌의 통상 보고 범위이며 [문헌 기준]입니다. 구체적 수치는 데이터셋과 평가 프로토콜에 따라 달라지므로 절대 비교가 아닌 등급 비교로 해석해야 합니다.

해석 시 주의: 위 표는 우열 판정표가 아닙니다. 본 플랫폼 수치는 내부 데이터에서, 비교 대상 수치는 각기 다른 데이터셋과 평가 프로토콜을 사용한 외부 보고에서 나온 것이므로 직접 비교가 성립하지 않습니다. 서로 다른 데이터셋에서 측정된 두 수치의 대소를 근거로 우위를 주장하는 것은 방법론적으로 타당하지 않으며, 따라서 이전 판에서 사용하던 '우위/동등' 판정을 철회하고 '비교 상태'로 대체했습니다. 동일 벤치마크 기반 직접 비교는 10.5절의 개선 항목으로 등록되어 있습니다.

그럼에도 이 표가 전달하는 유효한 정보가 있습니다. 오늘날 개별 예측 도구의 성능 수준은 상당 부분 수렴했으며, 어느 축에서도 압도적 격차가 존재하지 않는다는 사실입니다. 이는 차별화가 개별 축의 정확도가 아니라 축들을 어떻게 결합하고 어떤 순서로 적용하는가에서 발생한다는 것을 시사합니다. 다음 절이 그 지점을 다룹니다.

6.3 파이프라인 수준 농축 효율 — 실질적 차별점

농축 효율은 '무작위로 N개를 뽑았을 때의 성공률 대비, 계산 필터를 통과한 N개의 성공률 배수'로 정의됩니다. 이것이 고객이 실제로 지불하는 가치와 직결되는 지표입니다.

시나리오

무작위 기준 성공률

본 플랫폼 통과군 성공률

농축 배수

습식 실험 절감

효소 열안정성 개량 (+5°C 이상)

2 ~ 5%

30 ~ 45%

9 ~ 15

90%

효소 활성 개량 (2배 이상 k_cat)

1 ~ 3%

15 ~ 25%

8 ~ 15

85%

기질 특이성 전환

0.5 ~ 2%

10 ~ 20%

10 ~ 20

85%

de novo 결합 단백질 (기능성)

0.1 ~ 1%

5 ~ 15%

15 ~ 50

90%

발현 가능성 (가용성 발현)

20 ~ 40%

70 ~ 85%

2 ~ 3

50%



6-2. 시나리오별 농축 효율 — 전 수치 [내부 관측·미감사] 등급. 아래 검증 조건 고지를 반드시 함께 읽어야 합니다.

6-2의 검증 조건 — 이 표는 성능 보증이 아닙니다

본 표의 수치는 다음 조건을 충족하지 않으므로 공식 성능 주장으로 사용할 수 없습니다.
·
프로젝트 수(n), 후보 수(N), 성공 판정에 사용된 assay와 그 판정 임계값이 표준화된 형태로 집계되어 있지 않습니다.
·
신뢰구간이 산출되어 있지 않으며, 제시된 범위는 통계적 구간이 아니라 관측된 최소~최대의 서술입니다.
· '
무작위 기준 성공률' 열은 통제된 대조군 실험이 아니라 해당 분야의 통상적 보고값을 서술한 것이므로, 두 열의 비율로 계산된 '농축 배수'는 엄밀한 효과크기 추정치가 아닙니다.
·
프로젝트 난이도가 통제되지 않아 선택 편향(성공한 프로젝트가 과대 대표될 가능성)이 배제되지 않았습니다.
따라서 이 표는 '기대 가능한 개선의 방향과 대략적 규모'를 보여주는 참고 자료이며, 계약상 성능 보증의 근거가 아닙니다. 계약 시 성능 조항은 개별 표적에 대한 사전 진단 결과와 서면 합의된 성공 기준에 근거하여 별도로 정의됩니다. 표준화된 n·N·assay·신뢰구간을 갖춘 감사 가능한 성능 데이터셋 구축은 10.5절 개선 항목으로 등록되어 있습니다.



이 표를 읽는 올바른 방법

농축 배수는 프로젝트 난이도에 강하게 의존합니다. 표적이 잘 연구된 효소 계열이고 구조가 알려져 있으며 유사 개량 사례가 문헌에 존재하면 상단 값에 가깝고, 신규 접힘·신규 반응·구조 미지 표적이면 하단 값에 가깝습니다. 제안 단계에서 고객 표적에 대한 사전 진단(feasibility scan)을 수행하여 기대 구간을 사전에 제시하는 것을 표준 절차로 운영합니다. 근거 없는 상단 값 약속은 하지 않습니다.



6.4 기능 커버리지 매트릭스

기능 영역

본 플랫폼

기준선 B

기준선 C

기준선 D

de novo 골격 생성

×

×

역접힘 서열 설계

×

복합체 구조 예측

분자동역학 검증

×

자유에너지 섭동

×

양자화학 반응 장벽

×

안정성 다중모델 앙상블

×

면역원성 예측

×

용해도·응집 예측

×

특허 자유실시(FTO) 검토

×

×

×

구조 기반 FTO

×

×

×

코돈 최적화·합성성 검사

×

×

×

오프타깃 유전체 스캔

×

×

불확실도 전파·역분산 융합

×

×

×

파이프라인 재현성 지문

×

×

폐루프 재보정

×

×

×



6-3. ○ 완전 지원 / △ 부분 지원 또는 별도 모듈 필요 / × 미지원. [내부 평가]

이 매트릭스가 보여주는 본 플랫폼의 고유 영역은 네 가지입니다: 특허 자유실시 검토의 설계 단계 통합, 유전자 합성성까지 이어지는 종단 연결, 불확실도 기반 자동 가중, 그리고 폐루프 재보정입니다. 이들은 개별 예측 정확도가 아니라 '연구 결과를 사업화 가능한 자산으로 만드는' 층위의 기능이며, 학술 파이프라인과 상용 스위트 양쪽에서 일반적으로 다루어지지 않는 영역입니다.

6.5 운영 성숙도 비교

운영 항목

본 플랫폼

기준선 C (상용)

기준선 D (공개조합)

장기 무인 실행 (~주 단위)

지원 (감시 데몬 + 자동 복구)

부분

미지원

중단 후 재개(resume)

단계 캐시 기반 지원

부분

미지원

동일 입력 재현성

동일 검증 환경에서 결정론적 재현

높음

낮음

회귀 테스트 스위트

500개 이상 자동 테스트

벤더 내부

거의 없음

장애 알림·모니터링

이메일 + 상태 리포트

부분

없음

감사 추적(audit trail)

전 단계 로그 + 설정 스냅샷

부분

없음

GPU 자원 스케줄링

다중 파이프라인 동시 실행 지원

제한적

수동



6-4. 운영 성숙도. 테스트 수는 내부 회귀 스위트 실측치입니다. [내부 실측]

운영 성숙도는 계산 플랫폼의 실사용 가치를 결정하는 저평가된 요소입니다. 수 일간 실행되는 분자동역학이 중간에 실패하고 재개할 수 없다면, 이론적 정확도가 아무리 높아도 프로젝트는 진행되지 않습니다. 본 플랫폼은 단계별 캐시에 계산 지문을 부착하여, 코드가 변경된 단계만 재실행하고 나머지는 캐시에서 즉시 회수하는 구조를 갖습니다. 이는 배포 후 '아무것도 바뀌지 않는' 침묵 실패를 원천적으로 방지합니다.

6.6 본 플랫폼이 열위인 영역 (정직한 고지)

  • 그래픽 인터페이스: 상용 스위트 대비 대화형 시각화 도구가 제한적입니다. 본 플랫폼은 배치 처리와 리포트 산출에 최적화되어 있으며, 구조를 손으로 조작하며 탐색하는 작업에는 별도 뷰어 사용을 권고합니다.

  • 막단백질 및 대형 복합체: 지질 이중층 환경의 막단백질, 그리고 500 kDa 이상의 초분자 복합체는 현재 예측 신뢰도가 낮습니다. 해당 표적은 사전 진단에서 명시적으로 고지합니다.

  • 번역후 수식(PTM) 의존 기능: 당쇄화, 인산화 등이 기능에 필수적인 단백질은 현재 계산 모델이 이를 충분히 반영하지 못합니다. 진핵 발현 시스템 대상 프로젝트에서 제약 사항으로 작용합니다.

  • 본질적 무질서 단백질(IDP): 정적 구조가 존재하지 않는 표적에 대해서는 본 파이프라인의 구조 중심 평가 축 대부분이 무의미해집니다. 별도 앙상블 기반 접근이 필요합니다.

  • 절대 활성값 예측: 본 플랫폼은 후보 간 상대 순위에서 신뢰할 만하지만, k_cat이나 K_M의 절대값을 예측하지는 못합니다. 이는 현재 기술 전반의 한계이며 어떤 도구도 신뢰할 만한 절대값을 주지 못합니다.

  • 긴 시간척도 동역학: 알로스테릭 전이나 도메인 재배열처럼 마이크로초 이상이 걸리는 과정은 직접 시뮬레이션이 불가능하며, 향상 샘플링으로도 부분적으로만 접근됩니다.

  • 세포 환경 미반영: 계산은 대개 희석 용액을 가정하지만 세포질은 단백질 농도가 300 mg/mL를 넘는 혼잡 환경이며, 이 혼잡 효과는 충분히 모델링되지 않습니다.



7. 신약 개발 관점의 적용 — Modality별 전략

단백질 공학은 신약 개발에서 두 가지 역할을 합니다. 하나는 단백질(또는 그 유도체)이 곧 의약품인 경우(생물의약품)이고, 다른 하나는 단백질이 의약품을 만들거나 전달하는 도구인 경우입니다. 본 플랫폼은 양쪽을 모두 지원하며, 하나의 계산 골격(3장의 17단계 깔때기와 4장의 GC 모듈)modality에 따라 재구성하여 서로 다른 산출물을 만듭니다. 이 장은 '무엇을 만들 수 있는가'modality 단위로 구체적으로 나열하고, modality의 핵심 설계 과제와 이를 다루는 모듈, 그리고 성숙도를 정직하게 표기합니다.

7.1 생산 가능한 modality 전경

본 플랫폼이 하나의 표적에 대해 생성·평가할 수 있는 modality는 아래 표와 같습니다. '진입 모드'3장의 두 진입점(기존 분자를 개량하는 개량 모드, 자연계에 없는 골격을 새로 만드는 de novo 모드) 또는 공급된 설계를 평가만 하는 평가 모드를 뜻합니다. '성숙도'는 과장을 피하기 위한 정직 등급으로, 생성 파이프라인의 완비 여부를 구분합니다.

성숙도 등급의 정의 — 먼저 읽어 주십시오

생성 파이프라인 완비 — 골격/서열/융합체를 직접 생성하고 전체 평가 깔때기를 통과시키는 전용 파이프라인이 구현되어 있습니다.
개량 모드 (플러그인) — 기존 단백질 계열을 개량하는 전용 플러그인이 구현되어 있으며, 새 골격을 생성하기보다 야생형을 출발점으로 변이를 설계합니다.
평가·게이트 전용 — 공급된 설계에 대해 해당 modality 고유의 개발가능성·기하·약동학 축을 평가하고 게이트하지만, 후보의 3차원 생성 자체는 상위 생성 계열이 담당합니다.
잠재 (사용자 데이터 필요) — 파이프라인 골격은 존재하나, 유의미한 산출을 위해 고객이 출발 서열·삽입 위치 등 도메인 데이터를 공급해야 합니다.
이 등급 표기는 6장의 증거 등급 정책과 동일한 취지이며, '가능하다''완비되어 있다'를 혼동하지 않도록 하기 위한 것입니다.



산출물 (Modality)

진입 모드

대표 예시 (공개)

핵심 모듈

성숙도

효소 치료제 (ERT)

개량 / de novo

Cerezyme (imiglucerase)

GC-STAB, GC-KCAT, GC-IMMUNO, GC-ELEC, GC-PK

단일클론항체 (mAb / Fab / scFv)

de novo / 개량

Humira (adalimumab)

GC-LIBRARY, GC-FOLD, GC-FEP, GC-DEVELOP

나노바디 (단일도메인 VHH)

de novo / 개량

Cablivi (caplacizumab)

GC-FOLD, GC-DEVELOP, GC-IMMUNO

이중·다중특이 항체 (T세포 인게이저)

de novo + 포맷

Blincyto (blinatumomab)

GC-FORMAT, GC-FOLD, GC-IMMUNO

/ △

항체-약물 접합체 (ADC)

개량 + 포맷

Enhertu (T-DXd)

GC-FORMAT, GC-PK, GC-DEVELOP

/ △

de novo 미니바인더 (60~100 aa)

de novo

SARS-CoV-2 미니바인더 (연구)

GC-SCAFFOLD, GC-SEQDESIGN, GC-FOLD, GC-DOCK

표적단백질분해제 (PROTAC / 분자접착제)

평가

lenalidomide (분자접착제)

GC-TERNARY, GC-DOCK, GC-PK

펩타이드·거대고리 펩타이드

de novo

semaglutide (GLP-1)

GC-SCAFFOLD, GC-PK, GC-IMMUNO

조작 사이토카인 / 바이오베터

개량 / de novo

nemvaleukin alfa (조작 IL-2)

GC-STAB, GC-FORMAT, GC-IMMUNO, GC-PK

저분자 히트 (보조 modality)

de novo (화학)

발굴 단계 (특정 승인약 없음)

GC-DOCK, GC-QM, GC-FF

TCR / pMHC (TCR-T)

de novo

Kimmtrak (tebentafusp)

GC-FOLD, GC-MD, GC-IMMUNO

초소형 Cas 뉴클레아제 (단일 AAV)

de novo

Casgevy (exa-cel, CRISPR)

GC-SCAFFOLD~GC-GUIDE / GC-OFFTARGET

염기 편집기 (CBE / ABE)

de novo (융합)

Beam / Verve 임상 (base editing)

GC-FOLD, GC-MD, GC-GUIDE

프라임 편집기 (nCas + RT)

de novo (융합)

Prime Medicine 임상 (prime editing)

GC-FOLD, GC-MD, GC-GUIDE

후성유전 편집기 (dCas 이펙터)

평가

CRISPRoff 계열 (연구)

GC-FOLD, GC-OFFTARGET

RNA 편집 (ADAR 유도 가이드)

평가

WVE-006 (임상)

GC-GUIDE

억제 tRNA (PTC 리드스루)

평가

조작 tRNA (전임상)

GC-GUIDE

부위특이 재조합효소 (Bxb1 )

de novo

Bxb1 인테그라아제 (도구)

GC-SCAFFOLD, GC-MD

분자생물학 효소 툴킷 (14계열, 7.5)

개량 (플러그인)

연구·제조용 시약 (: 고정밀 중합효소)

GC-FIDELITY, GC-KCAT, GC-REMD, GC-STAB

산업용·치료용 de novo 효소 (바이오촉매)

de novo / 개량

sitagliptin 트랜스아미네이스

GC-SCAFFOLD, GC-QM, GC-KCAT, GC-REMD

AAV 캡시드 (조직 지향성)

라이브러리·평가

Zolgensma (AAV9); PHP.eB (조작)

GC-FORMAT, GC-IMMUNO, GC-DEVELOP

구조기반 백신 항원 (융합 전 고정, 8)

개량

Arexvy / Abrysvo (RSV 융합전 F)

GC-FOLD, GC-STAB, GC-MD

자기조립 항원 담체 (VLP·페리틴, 8)

de novo

Gardasil (HPV VLP)

GC-SCAFFOLD, GC-FOLD, GC-DOCK

개인맞춤 신생항원 백신 (8)

평가·랭킹

mRNA-4157 / V940 (임상)

GC-IMMUNO, GC-UQ



7-1. 생산 가능한 modality 목록. 성숙도: ◎(**) 생성 파이프라인 완비 / ○(*) 개량 모드 플러그인 / △(~) 평가·게이트 전용 / ▽(open) 잠재(사용자 데이터 필요). modality의 상세는 7.2~7.6절 및 8장에 전개됩니다. '대표 예시' 열은 해당 modality 범주가 실재함을 보이는 외부 공개 사례이며 본 플랫폼 산출물이 아닙니다(승인·임상·연구 단계 혼재). [내부 평가]

외부 문헌 인용에 관한 표기 원칙

이 장은 각 modality가 실재하고 임상적으로 검증된 범주임을 보이기 위해 공개된 승인 의약품과 대표적 방법론을 예시로 인용합니다. 이들은 타사·학계의 공개 사실이며 본 플랫폼의 산출물이 아닙니다. 인용은 제품명·방법명·연도 등 독자가 독립적으로 확인 가능한 형태로만 표기하며, 정확한 DOI·특허번호는 의도적으로 본문에 인쇄하지 않았습니다(6·10.5절과 동일한 이유 — 불확실한 식별자를 인쇄하는 것은 '확인 불가''날조'로 악화시키기 때문). 번호 인용이 부착된 참고문헌 부속서는 요청 시 별도 제공됩니다.



7.2 단백질·항체 치료제

7.2.1 효소 치료제 (Enzyme Replacement Therapy)

리소좀 축적질환처럼 특정 효소 결핍이 원인인 질환에서는 재조합 효소를 정맥 투여합니다(공개 사례: 고셔병 imiglucerase, 파브리병 agalsidase beta, 폼페병 alglucosidase/avalglucosidase alfa, ASMD olipudase alfa). modality의 핵심 과제는 효능 자체가 아니라 체내 안정성, 표적 조직 도달, 그리고 면역원성입니다. 특히 세포 내 리소좀 유입은 만노스-6-인산(M6P) 수용체 경로에 의존하므로 당쇄 설계가 효력을 좌우하며, 결핍 환자에서는 해당 단백질이 '외래'로 인식되어 항약물항체(ADA)가 생기기 쉽습니다.

플랫폼 적용: (a) GC-STABGC-REMD로 주변부 안정화 변이를 설계하여 혈장 프로테아제 저항성과 열안정성을 동시에 높입니다. (b) GC-IMMUNOADA 위험을 사전 평가하고 탈면역화 변이를 제안합니다. (c) GC-ELEC으로 리소좀의 산성 pH(4.5~5.0)에서의 활성·안정성을 평가합니다 — 중성 pH 최적 효소는 리소좀 내에서 실활할 수 있으므로 산성 조건 활성 유지를 설계 목표에 포함합니다. (d) GC-KCAT으로 후보 간 상대 촉매 효율을, GC-PK로 혈중 반감기 프록시를 평가합니다. 당쇄(M6P) 자체는 발현 숙주·공정에 강하게 의존하므로 계산이 아니라 습식·공정 단계에서 최적화되며, 이는 5장 발현 설계와 연동됩니다.

7.2.2 항체 및 항체 유래 분자

항체는 생물의약품 시장의 대부분을 차지하며 단백질 공학이 가장 성숙하게 적용된 영역입니다(역사적 이정표: 최초의 완전인간 항체 adalimumab은 파지 디스플레이로, humanizationCDR 이식 기법으로 확립). 본 플랫폼은 완전장 IgG뿐 아니라 Fab·scFv 단편, 그리고 낙타과 유래 단일도메인 나노바디(VHH; 공개 승인 사례 caplacizumab)까지 하나의 파이프라인으로 설계합니다. 최근에는 구조로부터 결합 부위를 직접 생성하는 de novo 항체 설계가 실증되어 (공개 문헌: RFdiffusion 계열, Nature 2025), 본 플랫폼의 de novo 진입 모드가 이 흐름에 해당합니다.

플랫폼 적용: 상보성결정부위(CDR) 라이브러리를 GC-LIBRARY로 설계하고, GC-FOLD로 항원-항체 복합체를 예측한 뒤, GC-FEP로 상위 후보의 결합 ΔΔG를 정밀 계산합니다. de novo 진입 시에는 GC-SCAFFOLD가 항원 에피토프를 앵커로 새 결합 골격을 생성합니다. 친화도만 최적화하면 응집성이 높거나 등전점이 극단적이거나 화학적 불안정 모티프(탈아미드화 감수성 Asn-Gly, 이성질화 감수성 Asp-Gly, 산화 감수성 노출 Met)를 포함한 후보가 상위에 오르므로, 개발가능성 축을 병렬 평가하는 것이 중요합니다. GC-DEVELOP이 이 모티프들을 자동 스캔하고, GC-PK가 점도·반감기를, GC-IMMUNO가 인간성(humanness)T세포 에피토프를 평가하여 CMC 단계 문제를 설계 단계로 앞당깁니다.

개발가능성 항목

위험 신호

플랫폼 검출 모듈

설계 대응

화학적 불안정성

Asn-Gly, Asp-Gly, 노출 Met/Trp

GC-DEVELOP

보존적 치환

응집 경향

표면 소수성 패치, 낮은 순전하

GC-SOL

하전 잔기 도입

등전점 극단

pI < 6 또는 pI > 9

GC-ELEC

표면 전하 재분배

점도 (고농도 제형)

정전기 상보 패치

GC-ELEC + GC-PK

패치 중화

면역원성

비생식세포계열 서열, T세포 에피토프

GC-IMMUNO

생식세포계열 복귀, 탈면역화

특허 저촉

공지 CDR과 높은 유사도

GC-FTO + GC-SIMSEARCH

회피 설계



7.2.3 이중·다중특이 항체 및 T세포 인게이저

이중특이 항체는 두 표적(또는 한 표적과 T세포 CD3)을 동시에 결합시켜 새로운 작용기전을 만듭니다(공개 승인 사례: CD19xCD3 blinatumomab, gp100xCD3 tebentafusp). modality의 지배적 설계 과제는 두 가지입니다. 첫째, 서로 다른 중쇄·경쇄가 올바르게 짝지어져야 하는 '사슬 짝짓기 문제', knobs-into-holes·CrossMab·공통 경쇄 등 포맷 공학으로 해결합니다. 둘째, T세포 인게이저의 경우 CD3 친화도를 조율하여 효능과 사이토카인 방출 증후군(CRS) 위험 사이의 균형을 잡아야 합니다.

플랫폼 적용: 각 결합 암(arm)7.2.2의 항체 파이프라인으로 생성하고, GC-FORMAT이 선택된 포맷에서의 사슬 짝짓기 정확도(오조립 위험)CRS 위험을 평가·게이트합니다. GC-FORMAT은 현재 공급된 조합에 대한 개발가능성 평가·게이트로 동작하며(성숙도 △), 후보 암 자체의 생성은 상위 항체 계열(성숙도 ◎)이 담당합니다. GC-FOLD로 삼자 복합체(항체 두 암 + 표적/T세포)의 기하학적 성립을, GC-PK로 포맷별 반감기(: 소형 인게이저의 짧은 반감기)를 평가합니다.

7.2.4 항체-약물 접합체 (ADC)

ADC는 항체의 표적 선택성과 세포독성 페이로드의 살상력을 결합합니다(공개 승인 사례: trastuzumab emtansine은 비절단 링커·DAR 3.5, trastuzumab deruxtecan은 절단 링커·DAR 강한 방관자 효과). 임상 실패의 주된 인자는 네 가지입니다: (1) 약물-항체 비율(DAR) — 과도한 DAR은 응집·빠른 청소율을 유발, (2) 링커 안정성 — 전신 순환 중 조기 방출 위험 대 종양 내 방관자 살상, (3) 페이로드 소수성에 따른 총 소수성 부하, (4) 접합 균일성 —무작위 결합 대비 위치특이(THIOMAB·비천연 아미노산) 결합의 예측 가능성.

플랫폼 적용: 항체 부분은 7.2.2 파이프라인으로 설계하고, GC-FORMAT의 접합 개발가능성 평가가 DAR 최적 구간(가우시안, 임상적으로 안정적인 중간 DAR 선호), 페이로드-링커 소수성 부하, 위치특이 접합 균일성, 링커 방출 프로파일을 정량화합니다. GC-PKDAR 상승에 따른 청소율·간 노출 위험을, GC-DEVELOP은 접합 후 응집 위험을 평가합니다. 방관자 효과는 표적 항원 밀도가 낮은 고형암에서는 이점, 정상 조직에서는 독성으로 작용하므로 GC-FORMAT은 이를 맥락 의존 가중으로 처리합니다.

7.2.5 de novo 결합 단백질 / 미니바인더

미니바인더는 60~100 아미노산 규모의 소형 단백질로 표적 표면에 고친화도로 결합하도록 완전히 새로 설계됩니다. modality는 계산 설계 그 자체가 실증된 대표 사례로(공개 문헌: SARS-CoV-2 스파이크 미니단백질 억제제 Science 2020, 표적 구조만으로부터의 결합 단백질 설계 Nature 2022, RFdiffusion Nature 2023), 항체보다 작아 조직 침투·생산성·안정성에서 유리하고 알려진 결합 파트너 없이 표적 표면 핫스팟만으로 설계할 수 있습니다. 핵심 과제는 낮은 실험적 적중률입니다 — 많은 설계가 발현되지 않거나 결합하지 않으므로, 계산 필터로 성공 후보를 농축하는 것이 이 modality의 실질 가치입니다.

플랫폼 적용: GC-SCAFFOLD가 표적 표면의 핫스팟 잔기를 앵커로 결합 골격을 생성하고, GC-SEQDESIGN이 이를 접히게 할 서열을 역설계하며, GC-FOLD의 다중 시드 합의로 예측 계면 신뢰도가 낮은 후보를 제거합니다. GC-DOCK(수렴 조건 충족 시) GC-FEP가 계면 결합을 정밀 평가하고, GC-MD가 생리 조건에서의 복합체 유지를 검증합니다. 3장의 깔때기가 이 modality에서 가장 극적으로 작동하는데, 낮은 적중률을 다축 필터로 보완하는 것이 핵심이기 때문입니다(6.3절의 농축 효율 참조).

7.3 항체를 넘어선 modality

7.3.1 표적 단백질 분해제 (PROTAC / 분자접착제)

표적 단백질 분해제는 표적을 억제하는 대신 세포의 유비퀴틴-프로테아좀 기구로 유도하여 분해시킵니다. 분자접착제는 E3 리가아제(: cereblon)에 신규 기질을 접착하며(공개 사례: lenalidomide IMiD 계열), PROTAC은 표적 리간드와 E3 리간드를 링커로 연결한 이기능성 분자입니다(공개 임상 후기 사례: ER 분해제 vepdegestrant, AR 분해제 bavdegalutamide — 승인 상태는 발행 시점 확인 필요). 핵심 설계 과제는 표적-분해제-E3 '삼원 복합체'가 생산적 기하로 형성되는가이며, PROTAC 링커 길이·조성이 협동성과 '훅 효과'를 좌우합니다.

플랫폼 적용: GC-TERNARY가 삼원 복합체의 협동성(α), 링커 기하 적합도, DC50/E3 프록시를 평가·게이트합니다(성숙도 △ — 생성이 아니라 공급된 분해제 설계의 평가). GC-DOCK가 표적·E3 각각의 리간드 결합 자세를 앙상블로 생성하고, GC-PK가 이기능성 분자 특유의 'Ro5 초과' 투과성·경구 흡수 위험을 평가합니다. 표적 단백질 자체가 신규 골격이 필요한 경우 상위 생성 계열로 파트너 단백질을 설계할 수 있습니다.

7.3.2 펩타이드 및 거대고리 펩타이드

펩타이드 치료제는 소분자와 항체 사이의 공간을 채웁니다 — 소분자보다 특이성이 높고 항체보다 작아 세포 내 표적·단백질-단백질 상호작용에 접근할 수 있습니다(공개 사례: GLP-1 계열, 경구 거대고리 PCSK9 억제제 등). 거대고리화·N-메틸화·주쇄 강직화로 'Ro5 초과' 화학 공간에 진입하며, 지배적 과제는 막 투과성·경구 생체이용률과 프로테아제 안정성, 짧은 반감기입니다.

플랫폼 적용: GC-SCAFFOLD가 표적 표면 모티프를 앵커로 고리형·선형 펩타이드 골격을 생성하고, GC-PK가 막 투과성·경구 흡수 프록시를 평가하며, GC-IMMUNOMHC 결합 기반 면역원성(짧은 서열의 낮은 면역원성과 담체 결합 시의 위험 모두)을 평가합니다. GC-FOLD의 공동접힘으로 표적-펩타이드 복합체 기하를 검증하고, 프로테아제 안정성은 절단 감수성 모티프 스캔으로 다룹니다. modalityCPU 중심으로 실행되어 대량 후보를 저비용으로 선별할 수 있습니다.

7.3.3 조작 사이토카인 및 바이오베터

사이토카인은 강력하지만 좁은 치료 창을 가집니다. 대표 과제는 수용체 서브유닛 편향입니다 —예를 들어 IL-2CD25(Treg 편향) 결합과 IL-2Rβγ 결합을 분리하여 항암(효과 T세포) 또는 자가면역(조절 T세포) 방향으로 편향시킬 수 있습니다(공개 사례: no-alpha IL-2 계열, PEGTreg 선택적 IL-2, 그리고 완전 계산 설계된 IL-2 모방체 Neo-2/15 Nature 2019). 바이오베터는 반감기 연장·안정성 개선·냉장 유통 불필요 등으로 기존 생물의약품을 개량합니다.

플랫폼 적용: GC-STAB·GC-REMD로 안정화·반감기 연장 변이를, GC-FORMAT으로 Fc 융합·이량체화 포맷을, GC-IMMUNO로 조작 변이의 신규 T세포 에피토프 위험을, GC-PK로 반감기·노출을 평가합니다. 수용체 편향 설계는 GC-FOLD로 사이토카인-수용체 복합체를 예측하고 GC-FEP로 서브유닛별 결합 ΔΔG 차이를 정밀 계산하여, 한 서브유닛 결합은 유지하고 다른 서브유닛 결합은 약화시키는 변이를 탐색함으로써 접근합니다. de novo 진입 시 GC-SCAFFOLD가 수용체 결합 계면을 재현하는 완전 신규 미모틴을 생성할 수 있습니다.

7.3.4 저분자 히트 발굴 (보조 modality)

본 플랫폼의 유일한 비단백질 modality, 표적 포켓에 대한 저분자 히트를 생성·평가합니다. 용도는 독립 저분자 후보, 분해제의 워헤드, 또는 병용 저분자입니다. 생성 화학 모델이 후보를 만들고, 도킹·상호작용 지문·양자 교차검증·역합성 분석이 이를 걸러냅니다. modalityCPU에서 실행되며 도킹·QM·역합성 등 무거운 단계는 선택적으로 활성화됩니다.

플랫폼 적용: GC-DOCK가 결합 자세를, GC-QM이 상호작용의 양자화학적 타당성을, GC-FF가 비표준 리간드의 역장 파라미터를 담당합니다. 합성 가능성(역합성 경로 존재)과 약물성(ADMET·독성·BBB 프록시)이 품질 게이트로 작동하여, 합성 불가능하거나 독성 신호가 강한 후보를 조기에 제거합니다. 단백질 modality와 동일한 불확실도 전파·역분산 융합 원칙이 적용됩니다.

7.3.5 TCR / pMHC 설계 (TCR-T)

T세포 수용체(TCR) 기반 치료제는 세포 표면뿐 아니라 세포 내 단백질에서 유래한 펩타이드-MHC(pMHC) 복합체를 인식할 수 있어, 항체가 접근하지 못하는 종양 항원을 표적할 수 있습니다(공개 사례: 가용성 TCR 기반 이중특이 tebentafusp). 핵심 과제는 pMHC에 대한 특이성과 친화도를 높이면서 정상 조직 자기펩타이드에 대한 교차반응(alloreactivity)을 억제하는 것입니다 — 친화도 성숙이 과도하면 치명적 표적 외 독성을 유발할 수 있습니다.

플랫폼 적용: GC-FOLDTCR-pMHC 공동접힘을 예측하고, GC-MD가 계면 안정성을 검증하며, 전용 교차반응(alloreactivity) 평가가 유사 자기펩타이드에 대한 결합 위험을 점수화합니다. GC-IMMUNO가 대립유전자별 MHC 제시를, GC-FEP가 상위 후보의 결합 ΔΔG를 정밀 계산합니다. 특이성-친화도 균형을 명시적 목적함수로 두어, 친화도만 높은 위험 후보가 상위에 오르지 않도록 설계합니다.

7.4 유전자·전사체 편집 도구

유전자 편집 도구는 단백질(효소)과 핵산(가이드)의 복합체이므로 두 요소를 함께 최적화해야 합니다. 임상 관점의 공통 과제는 세 가지입니다: 오프타깃 작용 최소화, 전달 가능한 크기, 그리고 면역원성(미생물 유래 단백질 특유의 높은 위험). 아래 하위 절은 편집 방식별로 본 플랫폼이 생성·평가할 수 있는 도구를 구체화합니다.

오프타깃 방향성 함정 — 왜 이것이 안전성의 핵심인가

표적 인식 서열의 방향성과 인식 모티프(PAM ) 위치는 편집 시스템마다 다릅니다. 이를 잘못 처리하면 오프타깃 점수가 일률적으로 0에 가깝게 나와 '모든 설계가 안전하다'는 위험한 오판을 낳습니다(실제로 특이성 계산이 서열 슬라이스 처리 오류로 항상 통과하던 결함이 내부에서 확인된 바 있습니다). GC-OFFTARGET은 시스템별 모티프 규격을 명시적으로 분리하여 이 함정을 방지하며, 유전체 전역에서 유사 부위를 탐색해 부위별 절단 확률을 점수화합니다.



7.4.1 초소형 Cas 뉴클레아제 (단일 AAV)

CRISPR 치료제의 임상 진입이 시작되었으나(공개 승인 사례: 최초의 CRISPR 치료제로 BCL11A 인핸서를 편집하는 exa-cel, 2023), 대표 효소 SpCas9(1,368 aa)는 프로모터·가이드와 함께 단일 AAV(4.7 kb 한계)에 탑재하기에 큽니다. 이 때문에 SaCas9(1,053 aa)나 초소형 Cas12f 계열(AsCas12f1 422 aa, 공학적 CasMINI 529 aa) 같은 소형 효소가 필요하나, 소형 효소는 온타깃 활성이 낮은 경향이 있어 단백질 공학으로 이를 회복해야 합니다. 본 플랫폼의 flagship 파이프라인이 바로 이 초소형 뉴클레아제의 de novo 설계입니다.

플랫폼 적용: 전체 17단계 깔때기가 이 modality에서 완전히 전개됩니다. GC-SCAFFOLDRuvC/HNH 촉매 도메인을 담는 골격을 생성하고, GC-SEQDESIGN이 서열을 역설계하며, GC-GUIDE가 온타깃 효율을(내부 검증에서 실측 편집 효율과 Spearman ρ ≈ 0.78~0.79 상관 [내부 실측]), GC-OFFTARGET이 유전체 전역 오프타깃을 평가합니다. GC-FOLD·GC-MD가 뉴클레아제-가이드-DNA 삼자 복합체의 구조와 안정성을, 촉매 기하 게이트가 활성 부위의 촉매 가능성을 검증하며, GC-IMMUNO가 미생물 유래 단백질의 면역원성 위험을 평가합니다. 최종 산출물에는 LNP 전달을 위한 페이로드 프로파일이 첨부됩니다(7.6.2).

7.4.2 염기 편집기 및 프라임 편집기

염기 편집기는 이중가닥 절단 없이 단일 염기를 전환하고(시토신 CBE, 아데닌 ABE), 프라임 편집기는 nCas9-역전사효소 융합과 pegRNA'검색-치환' 편집을 수행합니다(공개 방법: 각각 Nature 2016/2017, Nature 2019; 공개 임상 프로그램: PCSK9/ANGPTL3 생체 내 염기편집, 만성 육아종증 프라임편집 등). 중요: 앞서의 exa-cel은 염기편집이 아니라 Cas9 이중가닥 절단 편집이며 이 둘은 구분되어야 합니다. 핵심 과제는 창(window) 내 방관 편집, 디아미네이스의 DNA/RNA 표적 외 편집, 그리고 큰 편집기+RT 카세트의 전달입니다.

플랫폼 적용: 본 플랫폼은 염기 편집기(디아미네이스-Cas 융합, 기본 TadA-8e 계열)와 프라임 편집기(Cas-RT 융합, 기본 M-MLV RT 계열)를 전용 융합 파이프라인으로 설계합니다. GC-FOLD가 융합체의 홀로 구조를, GC-MD가 링커·RT 루프 동역학을 검증하며(융합 단백질에서 링커 길이·유연성이 활성을 좌우하므로 핵심), GC-GUIDE/GC-OFFTARGET이 편집 창과 오프타깃을 평가합니다. 방관 편집 위험은 편집 창 내 표적 외 염기의 존재를 명시적으로 점수화하여 다룹니다.

7.4.3 후성유전 편집기 (dCas 이펙터)

후성유전 편집기는 촉매 불활성 dCas에 후성유전 이펙터(: DNA 메틸전이효소 또는 탈메틸화 효소)를 융합하여, DNA를 절단하지 않고 유전자 발현을 켜거나 끕니다(공개 개념: CRISPRoff 등 안정적 메틸화 편집). DNA 비절단 특성 덕분에 안전성 프로파일이 유리하나, 효과의 지속성과 전사 시작점(TSS) 대비 표적 위치의 정확성이 관건입니다.

플랫폼 적용: 후성유전 이펙터 점수 평가가 DNA 비절단 이펙터의 배치와 TSS 거리 적합성을 평가·게이트합니다(성숙도 △). GC-FOLDdCas-이펙터 융합의 구조 성립을, GC-OFFTARGETdCas 자체의 표적 외 결합을 평가합니다. 융합체의 골격·서열 생성이 필요한 경우 상위 생성 계열(GC-SCAFFOLD·GC-SEQDESIGN)로 이관됩니다.

7.4.4 RNA 편집 및 억제 tRNA

이 계열은 DNA를 영구 변경하지 않고 RNA 수준에서 작용하여 가역성·안전성 이점을 가집니다. ADAR 유도 편집은 가이드 올리고가 내인성 ADAR을 모집하여 A-to-I(생물학적으로 G로 읽힘) 편집으로 점 돌연변이를 복원합니다(공개 사례: 인체 최초의 치료적 RNA 편집 실증 WVE-006, AATD). 억제 tRNA는 조기 종결코돈(PTC)을 리드스루하여 전장 단백질 발현을 복원합니다(공개 문헌: 조작 tRNA Nature 2023; DMD 디스트로핀 복원 보고). 핵심 과제는 각각 표적 외 A-to-I 편집의 특이성, 그리고 정상 종결코돈을 억제하지 않으면서 높은 리드스루 효율을 얻는 것입니다.

플랫폼 적용: ADAR 가이드 점수 평가가 편집 창·편집 지수를, 억제 tRNA 점수 평가가 PTC 리드스루 효율과 +1 문맥을 평가·게이트합니다(성숙도 △). 이 두 하위 modality는 핵산 서열 설계이므로 GC-GUIDE의 가이드 발굴·설계 계열과 연동되며, 표적 외 편집·억제 위험은 GC-OFFTARGET 원리의 확장으로 다룹니다. 단백질 성분이 없으므로 구조·MD 계열은 대부분 비활성화되어 계산 비용이 낮습니다.

7.4.5 부위특이 재조합효소

세린 재조합효소(: Bxb1, phiC31, TP901)는 특정 부착 부위(att) 쌍을 인식하여 큰 DNA 카세트를 절단·삽입·역위시킵니다. CRISPR과 달리 이중가닥 절단 후 숙주 수복에 의존하지 않아 정밀한 대규모 삽입(: 전장 유전자 노크인)에 유리합니다. 핵심 과제는 att 부위 특이성과 재조합 효율, 그리고 새로운 표적 부위로의 특이성 재프로그래밍입니다.

플랫폼 적용: 본 플랫폼은 재조합효소를 de novo 진입 모드로 설계합니다. GC-SCAFFOLD가 촉매 골격을 생성하고 GC-SEQDESIGN이 서열을 역설계하며, GC-MD가 재조합효소-DNA 복합체의 안정성을, GC-FOLDatt 인식 계면의 기하를 검증합니다. att 특이성 재프로그래밍은 DNA 결합 잔기의 조합 라이브러리(GC-LIBRARY)로 접근합니다.

7.5 분자생물학·제조용 효소 툴킷

앞의 절들이 '의약품이 되는 단백질'을 다뤘다면, 이 절은 '의약품과 유전물질을 만드는 효소'를 다룹니다. 본 플랫폼은 분자생물학 반응에 쓰이는 효소 계열을 전용 플러그인으로 개량합니다 —즉 야생형(또는 시판 등가물)을 출발점으로 충실도·열안정성·촉매효율·기질범위를 개선하는 개량 모드입니다. 이 툴킷은 mRNA 치료제, 효소적 유전자 합성, PCR/등온증폭, 클로닝, 차세대 염기서열분석 라이브러리 제작 등 상류 제조 공정 전반을 뒷받침합니다.

효소 계열

대표 표적 (공개 등가물)

주요 개량 목표

핵심 모듈

고충실도 DNA 중합효소

고정밀 PCR 중합효소 계열

충실도·프로세시비티·속도

GC-FIDELITY, GC-REMD, GC-KCAT

역전사효소

고온·고프로세시비티 RT 계열

열안정성·프로세시비티·RNase H 제거

GC-FIDELITY, GC-REMD, GC-STAB

RNA 중합효소 (T7/T3/SP6)

-dsRNA T7 RNAP 계열

-dsRNA 부산물·2'-변형 수용·수율

GC-FIDELITY, GC-MD, GC-KCAT

말단전이효소 (TdT)

주형비의존 합성용 TdT

가역 종결 뉴클레오타이드 수용·단일염기 제어

GC-KCAT, GC-STAB, GC-DOCK

DNA/RNA 리가아제

고효율 접합 리가아제 계열

접합 효율·평활말단 활성·특이성

GC-KCAT, GC-STAB

CRISPR 뉴클레아제 (Cas9/12/13)

고정밀 Cas 변이체

특이성·PAM 완화·소형화

GC-GUIDE, GC-OFFTARGET, GC-FOLD

프로테아제

특이 절단 프로테아제(TEV )

절단 특이성·활성

GC-DOCK, GC-KCAT

트랜스포사아제

삽입 효율 Tn5 계열

삽입 효율·편향 감소

GC-MD, GC-STAB

글리코실라아제/뉴클레아제/키나아제/포스파타아제/메틸전이효소

UDG·엑소뉴클레아제·PNK·rSAP·메틸전이효소

기질 특이성·열가역성·활성

GC-KCAT, GC-STAB, GC-DOCK



7-2. 분자생물학 효소 툴킷 (개량 모드 플러그인 14계열의 요약). 표적은 시판 효소의 공개 등가 범주이며, 실제 프로젝트는 고객이 지정한 출발 서열에서 시작합니다. [내부 평가]

7.5.1 고충실도 중합효소 및 역전사효소

중합효소 충실도는 오류율로 정의되며 GC-FIDELITY가 이를 다축 합의로 추정합니다 — 염기 선택 에너지, 중합-교정(exo) 도메인 간 기하, 활성화 장벽을 결합합니다. 이 축들은 후보 간 상대 순위에서 신뢰할 만하지만 절대 오류율은 산출하지 않습니다(6.6·4.6절 고지). 열안정성은 GC-REMD의 전이 온도 추정으로, 촉매 회전수는 GC-KCAT으로 평가합니다. 이 계열은 고정밀 PCR·차세대 서열분석 라이브러리 제작·역전사 등에 직접 쓰입니다.

7.5.2 RNA 중합효소 (-dsRNA T7)

T7 RNA 중합효소는 시험관 내 전사(IVT)mRNA 치료제·백신을 생산하는 핵심 효소입니다. 야생형 T7은 이중가닥 RNA(dsRNA) 부산물을 만들어 자연면역을 자극하므로, -dsRNA 변이가 mRNA 순도와 안전성에 결정적입니다. 본 플랫폼은 저-dsRNA·2'-변형 뉴클레오타이드 수용·수율을 목적함수로 하는 RNAP 개량을 지원합니다(공개 표적 범주: -dsRNA T7 계열). GC-FIDELITY가 전사 충실도를, GC-MD가 신장 복합체 안정성을, GC-KCAT이 전사 효율을 평가합니다.

7.5.3 TdT / 효소적 핵산 합성

말단 데옥시뉴클레오타이드 전이효소(TdT)는 주형 없이 3' 말단에 뉴클레오타이드를 부가하는 효소로, 유해 화학물질을 쓰는 포스포아미다이트 화학을 대체하는 효소적 DNA 합성의 핵심입니다(공개 방향: 3'-가역 종결 뉴클레오타이드를 수용하도록 진화시켜 단일염기 제어 달성; 문헌 보고로 약 80개 치환·32라운드·사이클당 99% 초과 부가). 자연 TdT는 주형비의존이지만 통제 불가하므로, 단일염기 제어를 위해서는 부피가 크고 하전된 가역 종결 기질을 효율적으로 받아들이도록 활성 부위를 재설계해야 하며, 구조화된 3' 말단(헤어핀) 활성과 열안정성도 요구됩니다.

플랫폼 적용: modality는 본 플랫폼의 뿌리이자 대표 검증 대상입니다. 전용 TdT 플러그인이 4방향 dNTP 패널과 변형 뉴클레오타이드 패널에 대한 선택성을 평가하고, 2가 이온 기하 게이트가 촉매 배위를 검증합니다. GC-KCAT이 기질별 상대 부가 효율을, GC-DOCK이 가역 종결 기질의 결합 자세를, GC-STAB·GC-REMD가 안정성을 평가하며, 이황화 결합 도입 등 안정화 설계가 함께 탐색됩니다. 사이클당 효율이 긴 올리고 합성의 오류 누적을 좌우하므로, 상대 부가 효율 순위가 이 modality의 가장 중요한 산출 지표입니다.

7.5.4 산업용 바이오촉매 및 de novo 효소

원료의약품(API) 제조에 쓰이는 생촉매는 화학 합성 대비 입체선택성이 높고 유기용매·중금속 촉매를 줄여 규제·환경 양면에서 유리합니다(공개 사례: sitagliptin 제조용 조작 트랜스아미네이스). 나아가 자연계에 없는 반응을 촉매하는 완전 de novo 효소 설계가 계산 설계의 대표 성과로 실증되었습니다(공개 문헌: retro-aldolase Science 2008, Kemp eliminase Nature 2008, deep learning 루시퍼레이스 Nature 2023, 촉매 모티프 스캐폴딩 고효율 효소 Nature 2025). 1세대 de novo 효소는 kcat이 낮아 지향진화가 필요했으나, 최근 방법은 설계만으로 자연 효소에 근접한 효율에 도달하고 있습니다.

플랫폼 적용: 산업 효소의 목적함수는 치료용 단백질과 다릅니다 — 면역원성은 무관하고, 대신 고온·유기용매·극단 pH 내성과 높은 전환수(TON)가 중요합니다. GC-REMD의 열안정성 축과 GC-MD의 유기용매 조건 가중을 높이고 GC-IMMUNO를 비활성화하는데, 이 재구성은 설정 수준에서 이루어지며 코드 변경이 필요하지 않습니다. de novo 효소 설계에서는 GC-SCAFFOLD가 촉매 모티프(theozyme)를 앵커로 활성 부위를 배치하고, GC-QM이 전이상태 안정화(활성화 장벽 감소), GC-KCAT이 상대 촉매 효율을 평가합니다.

7.6 전달 지향 설계

7.6.1 AAV 캡시드 공학

AAV는 승인된 유전자 치료 벡터의 주류이나(공개 사례: 망막 voretigene, SMA onasemnogene abeparvovec ), 조직 지향성 제어와 기존 중화항체 회피가 미해결 과제입니다. 대표적 공학 사례인 PHP.eBAAV9588~589 잔기 사이 7-mer 펩타이드 삽입으로 혈액뇌장벽을 통과하나, 이 통과는 특정 마우스 계통(Ly6a 수용체) 의존적이며 영장류로 이행되지 않는 것으로 보고되어 '전임상-임상 이행 격차'의 교과서적 사례입니다 — 본 플랫폼은 이 한계를 명시적으로 고지합니다.

플랫폼 적용 (성숙도 ▽ — 잠재): 캡시드 삽입 라이브러리 다양성·개발가능성 평가와 중화항체 에피토프 패널이 구현되어 있으나, 유의미한 산출을 위해서는 고객이 AAV 혈청형 서열과 삽입 위치를 공급해야 합니다(플랫폼에 특정 혈청형 서열이 내장되어 있지 않음). GC-FORMAT이 삽입 펩타이드 라이브러리의 다양성을, GC-IMMUNO가 중화항체 회피를, GC-DEVELOP이 캡시드 조립 관련 개발가능성을 평가합니다. 마우스-영장류 이행 위험은 계산으로 해소되지 않으므로 반드시 종간 검증이 필요함을 명시합니다.

7.6.2 LNP 페이로드 매칭

단백질·유전자 치료 물질을 지질나노입자(LNP)로 전달할 때, 페이로드의 물성(분자량, 등전점, 표면 전하)은 이온화 지질 비율과 완충액 pH 선택을 좌우합니다. 본 플랫폼의 설계 산출물에는 이 물성을 담은 페이로드 프로파일이 표준 스키마로 첨부되어, 전달 설계 단계로 무손실 인계됩니다(: 7.4.1의 초소형 Cas 뉴클레아제 RNPLNP로 전달하는 경우).

플랫폼 적용: GC-ELEC이 표면 전하·등전점을, GC-SOL이 용해도·응집을 산출하고, 이 값들이 페이로드 프로파일로 구조화됩니다. 이는 별도 전달 설계 파이프라인(LNP 최적화)과의 계약 인터페이스로 작동하며, 4.6절의 모듈 교체 가능성 보증과 동일하게 스키마 안정성이 보장됩니다.

7.7 규제 대응 관점

in-silico 설계 결과가 규제 제출 자료에 사용될 때 심사자가 요구하는 것은 예측의 정확도 자체가 아니라 '어떻게 그 결정에 도달했는가'의 추적 가능성입니다. 본 플랫폼은 이를 위해 세 가지를 제공합니다. 첫째, 모든 실행에 대해 설정 스냅샷과 계산 지문이 보존되어 동일 결과를 재현할 수 있습니다. 둘째, 각 후보가 어떤 단계에서 왜 선택·탈락되었는지가 단계별 로그에 기록됩니다. 셋째, 예측값에는 불확실도가 부착됩니다 — GC-UQ가 등각예측 구간, 적용가능영역, 모델 신뢰도 등급을 산출하여 '이 값은 얼마나 믿을 수 있는가', 나아가 '이 표적이 모델의 적용 범위 안에 있는가'에 정량적으로 답합니다. 이는 modality 무관하게 교차 적용되며, ICH Q8 품질설계(QbD)의 핵심품질특성(CQA)·규제 경로 매핑과 연동됩니다.

다만 명확히 해야 할 점은, 현재 어떤 규제 당국도 in-silico 예측만으로 안전성이나 효능을 인정하지 않는다는 것입니다. 계산 결과의 규제상 역할은 실험 설계의 정당화와 위험 기반 접근(risk-based approach)의 근거 제공에 있으며, 본 플랫폼도 그 범위에서 가치를 주장합니다. modality가 다양해질수록 각 modality 고유의 규제 경로(: 유전자 치료제, 세포 치료제, 백신, 저분자)가 다르므로, GC-UQQbD 매핑은 modality별로 요구 자료의 형태를 조기에 제시하는 역할을 합니다.

modality를 가로지르는 공통 골격 — 하나의 파이프라인, 여러 산출물

modality들은 서로 다른 산출물을 만들지만 동일한 계산 골격을 공유합니다: 3장의 깔때기, 4장의 GC 모듈, 그리고 개발가능성·약동학·불확실도로 이어지는 번역 척추(GC-DEVELOP·GC-PK·GC-UQ)입니다. modality 전환은 대부분 (a) 진입점(개량/de novo/평가) 선택, (b) 활성화되는 modality 특이 모듈(GC-TERNARY·GC-FORMAT·GC-FIDELITY ), (c) 목적함수 가중치 재구성으로 이루어지며 코드 변경을 요구하지 않습니다. 이 구조 덕분에 새로운 modality 추가가 기존 산출물 형식·점수 스케일·리포트 구조를 깨지 않으며(4.6절 보증), 성숙도 등급으로 '가능''완비'를 정직하게 구분합니다.





8. 백신 개발 관점의 적용 — 항원 설계와 면역원성

백신 개발에서 단백질 공학의 역할은 치료용 단백질과 정반대입니다. 치료용 단백질에서는 면역 반응을 최소화하는 것이 목표지만, 백신에서는 원하는 면역 반응을 최대화하고 원하지 않는 반응을 억제하는 것이 목표입니다. 이 방향 전환이 설계 논리 전체를 바꿉니다.

8.1 항원 안정화 — 구조 기반 백신학의 핵심

많은 바이러스 표면 당단백질은 세포 진입 과정에서 대규모 구조 전이를 겪습니다. 융합 전(prefusion) 형태와 융합 후(postfusion) 형태가 존재하며, 중화 항체가 인식하는 가장 강력한 에피토프는 대개 융합 전 형태에만 존재합니다. 문제는 융합 전 형태가 준안정(metastable)하다는 것입니다 — 정제 과정이나 보관 중에 자발적으로 융합 후 형태로 전이되어 중화 에피토프를 상실합니다.

구조 기반 백신학의 핵심 전략은 융합 전 형태를 구조적으로 고정하는 것입니다. 대표적 방법은 (a) 유연한 힌지 영역에 프롤린을 도입하여 나선 연장을 물리적으로 차단하는 것, (b) 두 도메인을 가로지르는 이황화 결합을 도입하여 전이를 봉쇄하는 것, (c) 소수성 코어에 공동(cavity)을 채우는 변이를 넣어 융합 전 형태를 열역학적으로 안정화하는 것입니다. 이 접근은 여러 호흡기 바이러스 백신 개발에서 실증된 원리입니다.

플랫폼 적용: GC-FOLD로 융합 전·후 두 형태를 모두 예측하고, GC-MD로 두 형태의 상대 안정성을 비교합니다. GC-STAB이 융합 전 형태를 선택적으로 안정화하는 변이를 탐색하는데, 여기서 핵심은 '두 상태 간 안정성 차이(ΔΔΔG)'를 최적화한다는 점입니다 — 단순히 안정성을 높이면 융합 후 형태도 함께 안정화되어 아무 효과가 없습니다. 이황화 결합 후보는 GC-FOLD 구조에서 Cβ-Cβ 거리와 이면각 기하가 실제 형성 가능 범위에 있는지 검증합니다. 내부 검증 사례에서 후보 6개 중 기하학적으로 형성 가능한 것이 0개로 판정된 경우가 있었으며, 이는 '거리만 보고 이황화 결합을 제안하는' 흔한 오류를 구조 기반 검증이 잡아낸 예입니다 [내부 실측].

8.2 에피토프 집중화(Epitope Focusing)

전장 항원을 사용하면 면역계는 접근하기 쉬운 면역우세(immunodominant) 에피토프에 반응을 집중시키는데, 이 부위가 반드시 중화 에피토프인 것은 아닙니다. 오히려 많은 바이러스가 면역우세 부위를 가변적으로 유지하여 면역 회피를 달성합니다 — 항체가 생기긴 하지만 방어력이 없는 부위를 향하게 만드는 전략입니다.

대응 전략은 보존된 중화 에피토프만을 이식한 소형 스캐폴드 항원을 설계하는 것입니다. 이는 본질적으로 de novo 설계 문제이며, GC-SCAFFOLD가 에피토프 주쇄 기하를 모티프로 받아 이를 정확히 재현하는 새로운 골격을 생성합니다. 성공 기준은 (a) 이식된 에피토프의 주쇄 RMSD가 원본 대비 이내, (b) 해당 에피토프를 인식하는 기존 중화 항체와의 복합체 예측이 성립할 것, (c) 스캐폴드 자체가 면역우세 에피토프를 새로 만들지 않을 것 입니다. 세 번째 조건이 특히 까다로운데, 새로 설계한 골격은 인체 프로테옴에 없는 완전 신규 서열이므로 그 자체가 강한 면역원이 될 수 있기 때문입니다. GC-IMMUNO가 스캐폴드 영역과 에피토프 영역의 에피토프 밀도를 분리 계산하여 이 위험을 정량화합니다.

8.3 광범위 방어 항원 설계

변이가 빠른 병원체에 대해서는 특정 균주가 아니라 계통 전체를 커버하는 항원이 필요합니다. 계산적 접근으로는 조상 서열 재구성(ancestral sequence reconstruction)과 컨센서스 설계가 있습니다. 조상 재구성은 계통수를 이용해 현존 변이체들의 공통 조상 서열을 추정하는 방법으로, 재구성된 조상 단백질이 현존 후손들보다 열안정성이 높고 기질 범위가 넓은 경향이 있다는 것이 여러 계열에서 관찰되었습니다. 백신 항원에 적용하면 여러 변이체에 걸쳐 교차 반응하는 항체를 유도할 가능성이 있습니다.

플랫폼 적용: GC-COEVOGC-PLM이 계통 정보를 다루며, GC-LIBRARY의 조상 재구성 기능이 후보 조상 서열을 생성합니다. 생성된 조상 항원은 다시 전체 파이프라인을 통과하여 발현 가능성, 안정성, 면역원성이 평가됩니다. 광범위 방어 여부 자체는 계산으로 증명할 수 없으며 반드시 동물 실험 검증이 필요하다는 점을 명확히 합니다.

8.4 백신 플랫폼별 설계 제약

백신 플랫폼

단백질 설계상 제약

플랫폼 대응 모듈

핵심 고려사항

재조합 단백질 (서브유닛)

발현량, 정제 수율, 열안정성

GC-SOL, GC-STAB, GC-GENE

제조 원가가 항원 안정성에 직결

mRNA / DNA 백신

숙주 세포 내 발현·분비, 코돈, 신호서열

GC-GENE, GC-SOL

체내 발현이므로 정제 부담 없음, 대신 세포 내 접힘 중요

바이러스 유사입자 (VLP)

자기조립 능력, 항원 제시 밀도

GC-FOLD, GC-DOCK

다가 제시가 B세포 수용체 가교로 반응 증폭

벡터 기반

삽입 유전자 크기 제한, 벡터 면역

GC-GENE

페이로드 크기 제약이 설계 자유도 제한

펩타이드 백신

MHC 결합, 짧은 서열의 낮은 면역원성

GC-IMMUNO

보조제·담체 결합 필수



8.5 백신 특유의 안전성 신호

항원 설계에서 반드시 확인해야 할 안전성 항목이 두 가지 있습니다. 첫째, 인체 단백질과의 서열 유사성입니다. 항원 서열이 인체 단백질과 유의한 유사성을 가지면 분자 모방(molecular mimicry)에 의한 자가면역 반응 위험이 있습니다. GC-SIMSEARCH가 인체 프로테옴 대비 전역 검색을 수행하여 유사 구간을 플래그합니다. 둘째, 항체 의존성 증강(ADE) 위험 관련 에피토프입니다. 일부 병원체에서 비중화 항체가 오히려 감염을 촉진하는 현상이 보고되어 있으며, 알려진 위험 에피토프를 회피하는 설계가 요구됩니다. 이 부분은 병원체별 문헌 지식에 강하게 의존하므로, 플랫폼은 자동 판정을 제공하지 않고 해당 구간의 존재 여부만 보고하며 전문가 판단을 요청합니다.

8.6 개인맞춤 신생항원 백신

종양 특이 체세포 돌연변이에서 유래한 신생항원(neoantigen)은 정상 조직에 없으므로 이상적인 종양 표적입니다. 개인맞춤 신생항원 백신은 환자 종양/정상 서열분석 → 신생항원 예측·HLA 결합·면역원성 랭킹 → 상위 에피토프(통상 20~34) 선정 → mRNA/LNP 제조를 수 주 내에 수행하는 파이프라인입니다(공개 임상 사례: 흑색종 mRNA-4157/V940 + 펩브롤리주맙 KEYNOTE-942, 재발위험 감소; 췌장암 autogene cevumeran Nature 2023, 신생항원 특이 T세포 반응). 병목은 정확한 신생항원 우선순위 결정입니다.

플랫폼 적용 (성숙도 ◎ — 평가·랭킹 파이프라인 완비): 체세포 변이 호출로부터 변이/야생형 펩타이드를 추출하고(전사체 정본 고정이 필수 — 정본을 고정하지 않으면 변이 좌표가 어긋나 엉뚱한 펩타이드를 만듦), HLA 유전형을 결정하며, GC-IMMUNOMHC class I·II 제시와 결합 강도를 대립유전자별로 점수화합니다. GC-UQ가 각 후보의 예측 신뢰도와 적용가능영역을 부착하여, 신뢰도 낮은 신생항원이 상위에 오르지 않도록 합니다. 클론성·발현량 필터가 함께 적용되어 종양 전체에 존재하는 클론성 신생항원을 우선합니다.

8.7 자기조립 항원 담체 (VLP·나노입자)

항원을 나노입자 표면에 다가(multivalent)로 제시하면 B세포 수용체 가교를 통해 면역 반응이 증폭됩니다. 바이러스 유사입자(VLP)나 페리틴·엔캡슐린 같은 자기조립 스캐폴드가 이 담체로 쓰이며, 보존된 중화 에피토프를 정확한 기하로 제시하는 것이 핵심입니다. 8.2절의 에피토프 집중화와 결합하면, 보존 에피토프만 다가 제시하는 강력한 항원을 설계할 수 있습니다.

플랫폼 적용 (성숙도 ◎ — de novo 생성 파이프라인 완비): GC-SCAFFOLD가 에피토프 주쇄 기하를 모티프로 받아 자기조립 대칭 스캐폴드를 생성하고, GC-FOLD가 조립체와 항원 제시 계면을 예측하며, GC-DOCK가 제시 밀도·배향을 평가합니다. 새로 설계한 스캐폴드 자체가 강한 면역원이 될 수 있으므로 GC-IMMUNO가 스캐폴드 영역과 에피토프 영역의 에피토프 밀도를 분리 계산하여 이 위험을 정량화합니다(8.2절과 동일 원리).



9. 고객 관점 가이드 — 무엇을 주고, 무엇을 받는가

이 장은 계산생물학 배경이 없는 의사결정자도 프로젝트를 평가하고 관리할 수 있도록 작성되었습니다. 기술 용어는 최소화하고 실무 흐름 중심으로 기술합니다.

9.1 프로젝트 착수에 필요한 정보

구분

필수 여부

내용

없을 경우의 영향

표적 단백질 서열

필수

아미노산 서열 (FASTA)

de novo 모드가 아니면 착수 불가

개선 목표

필수

정량 목표 (: Tm +8°C, k_cat 3)

목적함수 정의 불가 — 반드시 정량화 필요

기존 구조 정보

권장

실험 구조 (PDB) 또는 근연 구조

예측 구조로 대체 가능하나 신뢰도 하락

기질/리간드 정보

권장

화학 구조 (SMILES/SDF)

활성 관련 축의 정밀도 하락

기존 실험 데이터

권장

변이체별 활성/안정성 측정값

보정 불가 — 1라운드 예측 정확도 하락

발현 숙주·벡터

권장

대장균/효모/CHO

코돈 최적화가 범용 설정으로 수행됨

특허 회피 대상

선택

회피해야 할 특허 번호 목록

일반 FTO 스캔만 수행

금지 변이/보존 잔기

선택

건드리면 안 되는 위치

모든 위치가 변이 대상이 됨



9.2 산출물 명세

프로젝트 종료 시 고객이 수령하는 산출물은 다음과 같습니다.

산출물

형식

내용

활용

후보 순위표

TSV / XLSX

후보별 전 평가축 점수, 불확실도, 종합 순위

실험 우선순위 결정

아미노산 서열 세트

FASTA

최종 후보 서열 + 야생형 대비 변이 목록

설계 검토

합성 발주용 DNA

FASTA / GenBank

코돈 최적화 완료, 벡터 클로닝 부위 포함

합성 업체 즉시 발주

구조 좌표

PDB / mmCIF

예측 구조 (단량체 및 복합체)

시각화, 추가 분석

위험 프로파일 리포트

PDF

FTO, 면역원성, 응집성, 안전성 항목별 평가

법무·규제 검토 입력

설계 근거 문서

PDF

각 후보가 선택된 생물학적 근거 서술

내부 보고, IP 출원 기초자료

실험 프로토콜 권고안

PDF

발현 조건, 정제 전략, assay 설계 제안

습식 실험 착수

재현성 패키지

아카이브

설정 스냅샷, 계산 지문, 실행 로그

감사 대응, 재계산



9.3 일정 및 마일스톤

단계

소요 기간

고객 액션

게이트 기준

0. 사전 진단 (feasibility)

3 ~ 5 영업일

표적 정보 제공

예상 농축 구간 제시 → 진행 여부 결정

1. 설계 사양 확정

1

목표 정량화 승인

목적함수 서면 합의

2. 계산 실행 (1라운드)

2 ~ 6

-

후보 순위표 중간 검토

3. 후보 검토 회의

1

후보 선정 참여

습식 투입 후보 확정

4. 유전자 설계·발주 사양

3 영업일

숙주/벡터 확정

합성 발주 가능 상태

5. 습식 실험

6 ~ 12

고객 또는 위탁 수행

실측 데이터 회수

6. 결과 분석·재보정

2

데이터 제공

예측-실측 상관 리포트

7. 2라운드 설계

2 ~ 4

목표 재조정

개선된 후보 세트



9-1. 표준 프로젝트 일정. 계산 기간은 표적 크기와 평가 축 수에 따라 변동합니다.

계산 기간이 2~6주로 넓은 이유는 파이프라인 후반부 단계(분자동역학, 자유에너지 섭동, 양자화학)GPU 시간을 대량 소모하기 때문입니다. 예산과 일정에 따라 이 단계들을 선택적으로 축소할 수 있으며, 그 경우 예측 정밀도와 소요 시간이 함께 감소합니다. 사전 진단 단계에서 이 트레이드오프를 명시적으로 제시합니다.

9.4 순위표 읽는 법

고객이 가장 자주 하는 질문은 '1위 후보만 실험하면 되는가'입니다. 답은 '아니오'이며, 그 이유를 이해하는 것이 이 플랫폼을 올바르게 활용하는 핵심입니다.

종합 점수는 여러 축의 가중 합이며, 점수가 비슷한 후보들은 통계적으로 구별되지 않습니다. 1위와 5위의 점수 차이가 각 후보의 불확실도보다 작다면 이들은 사실상 동순위입니다. 따라서 순위표에는 종합 점수와 함께 불확실도가 표기되며, 유의하게 구별되는 후보 그룹(tier)이 자동으로 묶여 제시됩니다.

더 중요한 점은 다양성입니다. 상위 10개 후보가 모두 동일한 설계 전략(: 같은 영역의 소수성 코어 충전)에서 나왔다면, 그 전략이 틀렸을 경우 10개 모두 실패합니다. 반면 서로 다른 전략에서 각각 뽑은 10개는 위험이 분산됩니다. 순위표는 후보를 설계 전략별로 군집화하여 표시하며, 실험 투입 시 여러 군집에서 고르게 선택할 것을 권고합니다. 이는 포트폴리오 이론과 동일한 논리입니다.

고객이 반드시 알아야 할 세 가지

계산은 순위를 주지 절대값을 주지 않습니다. '이 후보의 Tm62°C'가 아니라 '이 후보가 저 후보보다 안정할 가능성이 높다'가 우리가 제공할 수 있는 주장입니다.
② 1
라운드에서 목표를 달성하지 못하는 것은 실패가 아니라 예상 시나리오입니다. 실측 데이터로 모델을 보정하는 2라운드에서 성능이 크게 개선되는 것이 일반적 패턴입니다.
음성 결과도 가치가 있습니다. '이 전략은 작동하지 않는다'6개월이 아니라 3주 만에 확인하는 것이 이 서비스의 핵심 가치 중 하나입니다.



9.5 자주 묻는 질문

Q. 예측이 틀리면 어떻게 되나요?

예측은 통계적 진술이므로 개별 후보 단위로는 자주 틀립니다. 우리가 보증하는 것은 '통과군의 성공률이 무작위 대비 유의하게 높다'는 집합 수준 성질입니다. 계약 시 후보 수와 기대 성공률 구간을 명시하며, 근거 없는 개별 후보 보증은 하지 않습니다.

Q. 우리 데이터가 모델 학습에 사용되나요?

고객 데이터는 해당 프로젝트의 모델 보정에만 사용되며, 프로젝트 종료 시 격리 보관됩니다. 타 고객 프로젝트로의 전이는 명시적 서면 동의 없이 수행하지 않습니다.

Q. 설계 결과물의 지적재산권은 누구에게 있나요?

설계된 서열과 그로부터 파생되는 발명의 권리는 고객에게 귀속되는 것을 기본으로 하며, 계약서에서 확정합니다. 플랫폼은 FTO 검토를 제공하지만 이는 법률 자문이 아니며, 최종 판단은 고객 법무 조직의 몫입니다.

Q. 계산 결과를 논문에 사용할 수 있나요?

가능합니다. 재현성 패키지에 방법론 기술과 계산 지문이 포함되어 있어 방법(Methods) 섹션 작성과 심사자 재현 요구 대응이 가능합니다. 내부 모듈명은 기능 서술로 치환하여 기재하는 표준 문구를 제공합니다.

Q. 우리 내부 도구와 병행하거나 결과를 교차 검증할 수 있나요?

권장합니다. 산출물이 표준 형식(FASTA, PDB, TSV)이므로 고객 내부 도구에 그대로 입력 가능합니다. 교차 검증에서 불일치가 발견되면 원인 분석을 함께 수행합니다.

Q. 최소 프로젝트 단위는 무엇인가요?

사전 진단(3~5)이 최소 단위이며, 이 단계에서 표적의 난이도와 기대 성과 구간을 제시합니다. 진단 결과가 부정적이면 본 프로젝트를 권하지 않습니다.



10. 논문·공개 데이터·상용 소프트웨어 요구사항 충족 매트릭스

이 장은 본 플랫폼이 학술 출판, 공개 데이터 기준, 상용 소프트웨어 조달 요건에서 요구되는 항목들을 어느 수준으로 충족하는지 항목별로 평가합니다. 충족하지 못하는 항목은 명시하고 대응 계획을 함께 기술합니다.

10.1 학술 출판 요구사항

계산 생물학 분야 주요 저널이 요구하는 항목은 대체로 방법 재현성, 데이터 가용성, 코드 가용성, 통계적 엄밀성, 대조군 설정으로 수렴합니다.

요구 항목

요구 내용

충족도

근거 및 비고

방법 재현성

동일 입력→동일 출력 보장, 난수 시드 명시

충족

계산 지문 기반 재현, 시드 전량 기록

코드 가용성

심사자 접근 가능한 코드 제공

조건부 충족

고객 프로젝트는 비공개; 방법론 기술 + 실행 로그 제공

데이터 가용성

입력·출력 데이터 공개 또는 접근 절차 명시

충족

산출물 표준 형식, 아카이브 제공

통계적 엄밀성

불확실도 보고, 다중비교 보정

충족

전 축 표준오차 산출, 축 간 융합 시 분산 반영

대조군 설정

야생형/음성 대조 포함

충족

야생형 앵커링이 파이프라인 기본 동작

교차 검증

훈련·검증 분리, 정보 누출 방지

충족

OOF(out-of-fold) 평가 체계 운영

벤치마크 비교

공개 벤치마크 대비 성능 보고

부분 충족

일부 축은 공개 벤치마크 미실시

소프트웨어 버전 명시

전 의존성 버전 기록

충족

설정 스냅샷에 환경 전체 기록

윤리·이중용도 검토

이중용도 위험 서술

충족

병원체 관련 설계 시 별도 검토 절차 운영



10.2 공개 데이터베이스·표준 준수

표준/DB

요구 사항

충족도

비고

서열 형식 (FASTA/GenBank)

표준 준수 파싱·출력

충족

왕복 변환 검증 완료

구조 형식 (PDB/mmCIF)

표준 준수, 대형 구조 지원

충족

잔기 번호 5자리 초과 케이스 처리 포함

화학 구조 (SMILES/SDF/InChI)

표준 준수, 입체화학 보존

충족

-

유전체 좌표

표준 어셈블리 좌표계 사용

충족

표준 참조 유전체 기준

MIAPE 계열 메타데이터

실험 메타데이터 기술

부분 충족

계산 메타데이터는 완비, 습식 연계는 고객 시스템 의존

FAIR 원칙

Findable/Accessible/Interoperable/Reusable

부분 충족

I/R 충족; F/A는 고객 데이터 정책에 종속

ontology 태깅 (GO/EC)

기능 주석 표준 용어 사용

충족

-



10.3 상용 소프트웨어 조달 요건

기업 조달 심사에서 통상 요구되는 항목들에 대한 평가입니다. 특히 규제 산업 (제약·바이오) 조달에서 중요한 항목을 우선 배치했습니다.

조달 요건

요구 내용

충족도

비고

감사 추적 (Audit Trail)

누가·언제·무엇을 실행했는지 기록

충족

전 실행 로그 + 설정 스냅샷 보존

데이터 무결성

산출물 변조 탐지 가능

충족

계산 지문(체크섬) 부착

접근 통제

역할 기반 권한 관리

부분 충족

인프라 수준 통제; 애플리케이션 RBAC는 개발 예정

데이터 보존·폐기

보존 기간 정책, 안전 폐기

충족

계약 기반 정책 운영

재해 복구

장애 시 복구 절차 및 RTO 정의

부분 충족

단계 캐시 기반 재개 지원; 정식 DR 문서화 예정

버전 관리·변경 통제

변경 이력, 회귀 검증

충족

버전별 스냅샷 + 500개 이상 회귀 테스트

검증 문서 (IQ/OQ/PQ)

설치·운영·성능 적격성 문서

부분 충족

OQ 상당의 회귀 스위트 보유; 정식 패키지는 요청 시

21 CFR Part 11 대응

전자기록·전자서명 요건

미충족

현재 GxP 대상 시스템 아님 — 필요 시 별도 프로젝트

SLA·지원

응답 시간, 에스컬레이션 경로

충족

계약 기반

보안 (데이터 격리)

고객 간 데이터 격리

충족

프로젝트별 격리 저장

라이선스 명확성

3자 구성요소 라이선스 준수

충족

전 구성요소 라이선스 검토 완료 (10.4 참조)

장기 지원 (LTS)

버전 지원 기간 명시

부분 충족

직전 버전까지 병행 지원; 공식 정책 문서화 예정



10.4 3자 구성요소 라이선스 관리

본 플랫폼은 내부 모듈 계약 구조를 통해 백엔드 구성요소를 캡슐화합니다. 라이선스 관리 정책은 다음과 같습니다.

  1. 모든 백엔드 구성요소는 도입 전 라이선스 조항을 검토하며, 특히 '사용(use)' 제한과 '재배포(redistribution)' 제한을 구분하여 평가합니다. 학술 목적 한정 라이선스는 상업 프로젝트에서 사용하지 않습니다.

  2. 패키지 설치 가능성은 사용 허가와 무관합니다. 설치가 되더라도 라이선스가 상업적 사용을 금지하면 해당 구성요소는 배제하며, 이 원칙은 예외 없이 적용됩니다.

  3. 상업적 사용이 제한된 구성요소로 얻을 수 있는 기능이 필요한 경우, 공개 데이터로부터 자체 모델을 재구축하거나(데이터 라이선스와 코드 라이선스는 별개), 외부 데이터 서비스로 경로를 우회합니다.

  4. 라이선스 상태는 정기 재검토 대상이며, 조항 변경 시 해당 모듈의 백엔드를 교체합니다. 모듈 계약 구조 덕분에 이 교체가 고객 인터페이스에 영향을 주지 않습니다.

  5. 고객 산출물과 문서에는 내부 모듈 코드명만 사용하여, 백엔드 구성 정보가 노출되지 않도록 관리합니다.

라이선스 정책의 실무적 함의

고객이 본 플랫폼 산출물을 상업적으로 활용할 때 제3자 라이선스로 인한 제약이 발생하지 않도록 하는 것이 이 정책의 목적입니다. 학술 파이프라인을 그대로 사용하는 조직에서는 사업화 단계에서 '이 결과를 만든 도구는 상업 사용이 금지되어 있다'는 사실이 뒤늦게 발견되는 사례가 실제로 발생합니다. 본 플랫폼은 이 위험을 구조적으로 제거합니다.



10.5 미충족 항목 대응 계획

미충족/부분충족 항목

현재 상태

대응 계획

예상 시점

참고문헌 인용 부착

[문헌 통상범위] 수치에 번호 인용 없음

6장 전 문헌 주장에 번호 인용 + 참고문헌 목록 부속서 작성

단기 (최우선)

감사 가능한 성능 데이터셋

6-2n·N·assay·신뢰구간 부재

프로젝트별 표준화 집계 체계 구축 후 신뢰구간 포함 재산출

단기 (최우선)

동일 벤치마크 직접 비교

타 도구와 head-to-head 미실시

공개 벤치마크셋에서 동일 프로토콜 비교 수행 후 표 6-1 갱신

중기

공개 벤치마크 전 축 실시

일부 축만 실시

표준 벤치마크셋 확보 후 전 축 평가

중기

애플리케이션 수준 RBAC

인프라 수준만

역할 기반 권한 모듈 개발

중기

정식 DR 문서화

기술적 재개는 지원

RTO/RPO 정의 및 문서화

단기

IQ/OQ/PQ 패키지

OQ 상당 보유

요청 기반 정식 문서 작성

요청 시

21 CFR Part 11

미대응

GxP 적용 필요 고객 발생 시 별도 프로젝트

요청 시

공식 LTS 정책

직전 버전 병행 지원

지원 기간 정책 문서화

단기

막단백질 예측 정확도

낮음

막 환경 특화 모듈 도입 검토

중장기

PTM 반영

미반영

당쇄화 예측 모듈 통합 검토

중장기





11. 검증 체계, 품질관리, 재현성

11.1 3중 검증 원칙

플랫폼의 모든 산출물은 세 층위의 검증을 통과합니다. 이 체계는 계산 파이프라인에서 가장 위험한 실패 유형인 '조용한 실패(silent failure)'를 방지하기 위해 설계되었습니다. 조용한 실패란 프로그램이 오류 없이 종료되지만 결과가 무의미한 경우로, 오류 메시지가 없기 때문에 발견이 극도로 어렵습니다.

  1. 구조 검증 — 산출물이 형식적으로 올바른가. 서열에 비표준 문자가 없는지, 구조 좌표에 결손 원자나 충돌이 없는지, 수치가 물리적으로 가능한 범위인지 확인합니다.

  2. 메커니즘 검증 — 계산이 의도한 경로를 실제로 실행했는가. 결과값이 그럴듯하다는 것은 증거가 아닙니다. 로그에서 해당 계산 단계가 실제로 수행되었고 기본값이나 대체 경로로 우회하지 않았음을 확인합니다.

  3. 맥락 검증 — 결과가 다른 결과들과 모순되지 않는가. 안정성이 크게 향상되었다고 보고된 변이가 분자동역학에서는 오히려 불안정하다면, 둘 중 하나는 틀렸으며 조사가 필요합니다.

실제 사례: 통과한 테스트가 고장난 시스템을 승인한 경우

내부 개발 과정에서 회귀 테스트가 전부 통과했음에도 실제 실행 경로는 고장나 있던 사례가 있었습니다. 원인은 테스트가 무거운 계산 경로를 건너뛰도록 설정되어 있어 '테스트가 통과했다'는 사실이 '실제 경로가 작동한다'를 의미하지 않았기 때문입니다. 또한 0개의 테스트가 실행되었을 때 리포터가 이를 '성공'으로 집계한 사례도 있었습니다. 이후 검증 정책을 '결과(outcome)가 아니라 메커니즘(mechanism)을 단언하라'로 변경했고, 배포 완료는 실제 실행 로그에서 새 코드 경로가 확인될 때만 선언합니다.



11.2 회귀 테스트 체계

플랫폼은 500개 이상의 자동 회귀 테스트를 보유하며, 코드 변경 시 전량 실행됩니다 [내부 실측]. 테스트는 단위 수준(개별 함수의 수치 정확도), 통합 수준(모듈 간 데이터 전달 무결성), 시스템 수준(축소 규모 전체 파이프라인 실행)으로 계층화되어 있습니다.

배포 전 필수 절차는 기준선 비교(baseline diff)입니다. 변경 전후 동일 입력에 대한 산출물을 비교하여, 의도한 변경 외에 다른 값이 바뀌지 않았음을 확인합니다. 이 절차가 중요한 이유는 테스트 자체가 잘못된 동작을 계약으로 굳혀버리는 경우가 실재하기 때문입니다 — 버그를 수정했더니 그 버그를 전제로 작성된 테스트가 실패하는 상황이며, 이때 테스트를 수정할지 코드를 되돌릴지는 신중한 판단을 요구합니다.

11.3 재현성 보장 메커니즘

메커니즘

동작

보장 내용

계산 지문 (fingerprint)

코드의 의존 관계 전이 폐쇄를 해시하여 캐시 키로 사용

코드가 바뀌면 캐시가 자동 무효화 — 배포가 무의미해지는 일이 없음

설정 스냅샷

실행 시점의 전체 설정과 환경 정보를 저장

수개월 후에도 동일 조건 재현 가능

난수 시드 기록

모든 확률적 계산의 시드를 기록

고정 환경에서 확률적 단계까지 결정론적 재현

단계별 캐시

각 단계 산출물을 지문과 함께 보관

중단 후 재개 시 완료 단계 즉시 회수

산출물 체크섬

결과 파일에 무결성 해시 부착

전달 과정의 변조·손상 탐지



재현성 보증의 범위 — '동일 검증 환경'의 정의

본 문서의 재현성 주장은 무조건적 보증이 아니라 명시된 환경 조건 하에서의 보증입니다. 결정론적 재현이 성립하는 범위는 다음과 같습니다.
·
보증됨: 동일 컨테이너 이미지, 동일 라이브러리 버전, 동일 GPU 아키텍처, 동일 스레드 수 설정에서 실행한 경우 — 산출 수치가 결정론적으로 일치합니다.
·
보증되지 않음: GPU 아키텍처가 다르거나(부동소수점 연산 순서 차이), 수치 라이브러리 버전이 다르거나, 병렬 축약(reduction) 순서가 달라지는 스레드 수 변경이 있는 경우 — 이 조건에서는 최종 순위와 결론은 동일하게 유지되나 하위 유효숫자 수준의 수치 차이가 발생할 수 있습니다. 이는 본 플랫폼 고유의 한계가 아니라 부동소수점 병렬 연산의 일반적 성질입니다.
재현성 패키지에는 실행 환경 사양이 기록되므로, 재현 시도 시 환경 일치 여부를 먼저 확인할 수 있습니다. 비트 단위 동일성이 계약상 요구되는 경우 컨테이너 이미지 고정 배포를 별도 옵션으로 제공합니다.



11.4 예측-실측 대조 프로토콜

습식 데이터가 회수되면 표준화된 대조 분석을 수행합니다. 각 평가 축에 대해 예측값과 실측값의 Spearman 순위 상관을 계산하고, 상관이 유의하지 않은 축은 다음 라운드에서 가중치가 자동으로 하향됩니다. 동시에 예측이 크게 빗나간 개별 후보들을 분석하여 공통 패턴을 찾습니다 — 특정 구조 영역, 특정 변이 유형, 특정 물성 구간에서 체계적 편향이 있는지 확인하는 과정입니다.

이 분석 결과는 고객에게 라운드 리포트로 제공되며, 여기에는 '어떤 축이 이 표적에서 잘 작동했고 어떤 축이 실패했는가'가 정직하게 기술됩니다. 실패한 축을 숨기지 않는 것이 장기적 신뢰의 기반이며, 실무적으로도 다음 라운드의 자원 배분을 최적화하는 데 직접 사용됩니다.



12. 부록

12.1 용어집

용어

설명

ΔΔG (델타델타G)

변이가 자유에너지 차이를 바꾸는 정도. 음수는 안정화, 양수는 불안정화. 1 kcal/mol ≈ Tm 1~2°C 변화.

Tm (융해온도)

단백질의 절반이 변성되는 온도. 열안정성의 표준 지표.

k_cat (촉매 회전수)

효소 한 분자가 초당 처리하는 기질 분자 수. 촉매 효율의 핵심 지표.

K_M (미카엘리스 상수)

최대 속도의 절반에 도달하는 기질 농도. 낮을수록 기질 친화도가 높음.

역접힘 (Inverse folding)

주어진 3차원 구조를 만들어낼 아미노산 서열을 찾는 문제.

FTO (자유실시)

특정 기술을 타인의 특허를 침해하지 않고 실시할 수 있는지에 대한 검토.

ADA (항약물항체)

투여된 치료용 단백질에 대해 환자가 만드는 항체. 효능 소실과 안전성 문제의 주원인.

에피토프

면역계가 인식하는 항원의 특정 부위. T세포 에피토프는 MHC에 제시되는 펩타이드 조각.

MHC class II

항원제시세포 표면에서 CD4+ T세포에 펩타이드를 제시하는 분자.

융합 전/후 형태

바이러스 표면 단백질의 두 구조 상태. 중화 에피토프는 대개 융합 전 형태에만 존재.

공동번역 접힘

리보솜에서 단백질이 합성되는 도중에 이미 접히기 시작하는 현상.

봉입체 (Inclusion body)

세균 세포 내에서 잘못 접힌 단백질이 응집해 형성하는 불용성 덩어리.

등전점 (pI)

단백질의 순전하가 0이 되는 pH. 이 근처에서 용해도가 최소가 되어 응집 위험이 큼.

역분산 가중

여러 추정값을 융합할 때 불확실도가 작은 값에 더 큰 가중치를 주는 통계적 방법.

농축 배수 (Enrichment)

무작위 선택 대비 계산 필터 통과군의 성공률 배수.

조상 서열 재구성 (ASR)

계통수를 이용해 현존 서열들의 공통 조상 서열을 추정하는 방법.

오프타깃

의도한 표적 외의 부위에 작용하는 현상. 유전자 편집 안전성의 핵심 관리 항목.



12.2 산출물 파일 규격 요약

파일

형식

필수 필드/내용

candidates_ranked.tsv

TSV (UTF-8)

candidate_id, 종합점수, 축별 점수, 축별 표준오차, tier, 설계전략군집

designs.fasta

FASTA

헤더에 candidate_id, 야생형 대비 변이 목록 포함

synthesis_order.fasta

FASTA

코돈 최적화 DNA, 벡터 클로닝 부위 포함

synthesis_order.gb

GenBank

주석 포함 (CDS, 태그, 제한효소 부위, 합성 위험 구간)

structures/*.pdb

PDB

예측 구조, B-factor 컬럼에 국소 신뢰도 기록

risk_profile.pdf

PDF

FTO, 면역원성, 응집성, 안전성 항목별 평가

design_rationale.pdf

PDF

후보별 선택 근거 서술 (생물학적 해석 포함)

reproducibility/

디렉터리

설정 스냅샷, 계산 지문, 실행 로그, 체크섬



12.3 도입 검토 체크리스트

본 플랫폼 도입을 검토하는 조직이 내부적으로 확인해야 할 항목입니다.

[ ] 우리 표적의 개선 목표를 정량적 수치로 표현할 수 있는가? (: 'Tm +8°C' 수준의 구체성)

[ ] 표적 단백질의 서열과 가능하면 구조 정보를 제공할 수 있는가?

[ ] 기존 변이체 실험 데이터가 있는가? (있으면 1라운드부터 보정 가능)

[ ] 습식 검증을 수행할 역량 또는 위탁 경로가 확보되어 있는가?

[ ] 1라운드에서 목표 미달 시 2라운드를 진행할 예산과 일정이 있는가?

[ ] 설계 결과물의 IP 귀속과 FTO 책임 범위에 대해 법무 검토가 이루어졌는가?

[ ] 고객 데이터 취급 정책(보안·격리·보존)이 사내 기준을 충족하는가?

[ ] 규제 제출에 사용할 계획이라면 필요한 문서 수준(IQ/OQ/PQ )이 정의되어 있는가?

[ ] 표적이 막단백질·무질서 단백질·PTM 의존 단백질에 해당하지 않는가? (해당 시 사전 협의 필요)

[ ] 성공 기준과 실패 기준이 계약 전에 서면으로 합의되었는가?

12.4 즉시 실행 가능한 다음 단계

  1. 표적 정보 패키지 준비 — 아미노산 서열(FASTA), 가용한 구조 파일, 기존 실험 데이터, 개선 목표 정량 수치를 하나의 아카이브로 정리합니다.

  2. 사전 진단 요청 — 준비된 패키지로 3~5 영업일 소요의 feasibility scan을 요청합니다. 이 단계에서 예상 농축 구간과 주요 위험 요소가 제시됩니다.

  3. 진단 결과 검토 회의 — 제시된 기대 성과 구간이 사업 목표를 충족하는지 판단합니다. 충족하지 않으면 이 시점에서 중단하는 것이 합리적입니다.

  4. 설계 사양 서면 합의 — 목적함수, 성공/실패 기준, 산출물 범위, 일정, 비용을 확정합니다.

  5. 1라운드 착수 및 습식 검증 계획 병행 수립 — 계산 진행과 동시에 발현·정제·assay 계획을 준비하여 후보 확정 즉시 실험에 착수할 수 있도록 합니다.

검증 선언

본 문서에 기재된 파이프라인 단계 구성, 모듈 목록, 평가 축, 산출물 규격은 실제 운영 중인 플랫폼 구성에 대한 확인을 거쳐 작성되었습니다. 성능 수치는 출처를 [내부 실측] / [문헌 기준] / [프로젝트 의존]으로 구분하여 표기했으며, 확인되지 않은 값을 추정으로 채우지 않았습니다. 문헌 기준 범위는 해당 분야의 통상 보고 범위를 서술한 것으로 특정 논문의 단일 수치를 인용한 것이 아니며, 절대 비교가 아닌 등급 비교로 해석해야 합니다. 미충족 요구사항은 10.5절에, 기술적 열위 영역은 6.6절에 은폐 없이 명시했습니다.







통합 단백질 공학 플랫폼 기술백서 v3.0