기술 백서 - Delivery Engineering Platform™
핵산·단백질 카고 설계 · 전달체 설계 · 물리 기반 구조 예측 · 약전 기반 CMC/규제 계층을 하나의 재현 가능한 엔진으로 통합한 in-silico 우선 전달 엔지니어링 서비스.
|
항목 |
내용 |
|
문서 버전 |
v4.0 |
|
발행일 |
2026년 9월 28일 |
|
문서 등급 |
고객 배포용 (Customer-facing) / 대외비 아님 |
|
대상 독자 |
연구 책임자, 바이오텍 R&D 임원, 기술평가 심사역, 제형·CMC·규제 담당자 |
|
적용 범위 |
카고 모달리티 13종(핵산·단백질 페이로드) × 전달체 클래스 5종 / 서브타입 17종 |
|
작성 주체 |
(주)바이오니아 바이오파운드리센터 |
|
문의 |
geneorder@bioneer.co.kr |
본 백서는 플랫폼을 소프트웨어 제품 단위로 구분하지 않고 하나의 통합 서비스로 기술합니다. 내부 계산 엔진은 GC-계열 내부 모듈 코드명으로 표기하며, 어떤 GC-모듈이 어떤 외부 구성요소로 구현되는지는 본 문서 어디에도 대응시키지 않습니다. 각 모듈은 입력·출력·불확실도 계약으로 정의된 교체 가능한 백엔드 구조이므로, 백엔드 교체나 자체 모델 이관이 고객 인터페이스와 산출물 형식에 영향을 주지 않습니다. GC-계열 이름은 인터페이스이며 판(edition)이 바뀌어도 의도적으로 고정됩니다.
제3자 구성요소는 부록 A에서 라이선스별로 실명 열거합니다. 코드명은 모듈 정체성을 특정 백엔드로부터 독립시키기 위해 존재하며, 플랫폼이 무엇으로 지어졌는지를 감추기 위한 것이 아닙니다. 기술·법무 실사를 수행하는 고객은 스택의 라이선스 지위를 알아야 하므로, 부록 A가 모든 외부 구성요소와 그 라이선스, 상업적 사용 가능 여부를 이 시스템에 존재하는 라이선스 원문에 대조하여 열거합니다. 부록 A가 의도적으로 하지 않는 일은 어떤 구성요소가 어떤 GC-모듈을 구현하는지 명시하는 것입니다 — 그 대응이야말로 교체 가능한 백엔드를 공표된 의존성으로 굳혀 버리는 행위입니다.
반면 ICH·USP·Ph.Eur·EU GMP Annex 1·ISTA·ASTM 등 공개 규격과 공개 과학 이론은 실명으로 인용합니다 — 플랫폼이 스스로를 평가받는 기준이기 때문입니다. 수치는 [내부 실측] / [문헌 기준] / [검증 필요]로 출처를 명시합니다.
v4.0에서 새로 도입한 원칙이 하나 있고, 이 원칙이 본 문서의 모든 수치를 읽는 방법을 규정하므로 앞머리에 밝힙니다. 어떤 수치를 이전 판에서 인용할 수도 있고 현재 코드에 대해 다시 측정할 수도 있는 경우, 예외 없이 다시 측정했습니다. 그리고 측정 근거 — 상수명과 행 번호, 또는 수치를 산출한 명령 — 를 함께 적었습니다. 이전 판의 계수 기준을 재구성할 수 없는 항목은, 서로 다른 기준으로 센 두 수의 차이를 제시하는 대신 본 문서의 측정값만 적고 증감을 계산할 수 없다고 명시했습니다.
RNA 치료제 개발에서 '무엇을 발현시킬 것인가' 또는 '어떤 유전자를 침묵시킬 것인가'는 가장 쉬운 부분에 속합니다. 표적이 정해지면 서열 설계는 며칠이면 끝납니다. 프로그램이 실제로 좌초하는 지점은 그 서열을 세포질까지 온전히 배달하는 운반체, 즉 지질나노입자(LNP)와 그 주변 제형입니다.
이온화성 지질 하나가 동시에 만족시켜야 하는 조건은 서로 반대 방향으로 당깁니다. 혈중에서는 전기적으로 거의 중성이어야 합니다 — 그래야 혈청 단백질을 무차별적으로 결합하지 않고, 스쳐 지나가는 적혈구 막을 용혈시키지 않습니다. 그러나 엔도솜 안에서는 양전하를 띠어야 합니다 — 한계막을 불안정화해 페이로드를 방출하는 데 필요한 것이 바로 양전하입니다. 폴리음이온 페이로드를 완전히 감싸야 하므로 강한 정전기적 회합이 필요하지만, 목적지에서는 놓아 주어야 하므로 그 회합이 가역적이어야 합니다. 정맥 투여된 50 nm 이상 입자가 간으로 여과되는 기본 경향을 이겨내야 하고, 마지막으로 제조·충전·수송·보관을 거치는 동안 응집·산화·가수분해되지 않아야 합니다.
이것은 하나씩 순차적으로 최적화할 수 있는 다섯 개의 독립 규격이 아닙니다. 하나의 분자 설계를 다섯 방향으로 투영한 것이며, 어느 하나를 개선하면 통상 다른 하나가 악화됩니다. 이온화성 지질의 겉보기 pKa를 올리면 엔도솜 내 양성자화와 탈출이 개선되지만 혈장에서 양전하를 띠게 되어 옵소닌 결합과 간 청소율이 증가합니다. PEG-지질 밀도를 높이면 콜로이드 안정성과 보관 안정성이 개선되지만, 간세포 흡수가 실제로 의존하는 ApoE 흡착을 입체적으로 차단하고, 반복투여 생존을 좌우하는 항-PEG 리스크를 높입니다. 보조 인지질에 불포화를 도입하면 융합성과 탈출이 개선되지만, 안정성 예산을 지배하는 산화 가능한 알릴 위치가 도입됩니다.
이 다차원 절충 문제를 현재 업계는 서로 연결되지 않은 최소 세 개의 도구 사슬로 나누어 풉니다. 지질 설계를 위한 케모인포매틱스·머신러닝 스택, 입자 구조를 보기 위한 분자동역학 환경, 그리고 CMC(화학·제조·품질관리)를 위한 스프레드시트·LIMS·컨설팅 보고서의 조합입니다. 각 인계 지점마다 맥락이 소실되고 추적성이 끊기며 전사 오류가 새로 유입됩니다. 더 심각한 것은, 세 사슬이 서로 다른 시점에 서로 다른 팀에서 돌아가기 때문에 '생물학적으로 우수하나 제조 불가능한 입자'를 몇 달 뒤에야 발견한다는 점입니다 — 통상 허가용 안정성 배치 단계이고, 그 시점의 해결책은 재제형이며 비용은 1년입니다.
본 플랫폼은 그 사슬을 하나의 결정적(deterministic) 엔진으로 접습니다. 핵산 카고 설계, 이온화성 지질 설계, 조립 입자의 물리 기반 구조 예측, 생체 내 분포 예측, 그리고 실제로 허가 서류를 채우는 데 필요한 CMC·규제 계층이 하나의 파이프라인 안에서 같은 체크포인트 규약을 공유합니다. 결과적으로 연구자는 서로 조율되지 않은 수십 개의 보고서 대신 하나의 순위표를 받습니다. 그 순위표에서 1위인 분자는 동시에 제조·규제 리스크가 이미 열거된 분자입니다.
v3.0 백서는 파이프라인 코드 17,889행, 자동 테스트 979건 시점의 플랫폼을 기술했습니다. 본 문서가 기술하는 엔진은 32,967행이고 테스트 1,626건을 수집합니다. 약 두 달 만에 두 수치가 거의 두 배가 된 것이며, 증가의 성격이 규모보다 중요합니다. 추가분은 계산된 수치를 방어 가능한 수치로 바꾸는 계층에 집중되어 있습니다.
|
항목 |
v3.0 백서 시점 |
v4.0 (현재) |
측정 근거 |
|
파이프라인 코드 (파일 전체) |
17,889행 |
32,967행 |
엔진 모듈에 대한 wc -l |
|
- 그중 실행 코드 |
미보고 |
28,161행 (코드는 :4807부터) |
모듈 docstring :2-:4805가 4,804행 릴리스별 변경 이력 |
|
보조 모듈 파일 |
105 |
126 |
ls LNP/*.py |
|
자동 테스트 수집 |
979 |
1,626 |
pytest --collect-only -q |
|
테스트 파일 |
79 |
110 (본 스위트 105 + 도구 계층 5) |
파일 수 |
|
번호 부여 부모 스테이지 |
10 |
10 (구조 유지) |
스테이지 레지스트리 |
|
하프스테이지 훅 |
69 |
76 |
POST_STAGE_HOOKS L28292; _run_or_resume 고유 id 85 − 부모 9로 교차검증 |
|
등록 카고 타입 |
12 |
15 = 치료 모달리티 13 + 구조적 2 |
VALID_CARGO_TYPES L6324, CARGO_DEFAULTS L6519 (각 15키) |
|
- 치료 모달리티 |
12 |
13 (ssRNAi 추가) |
v3.0의 12종 + 단일가닥 RNAi |
|
- 구조적 항목 |
- |
2 (generic, custom_rnp) |
모달리티 미선언 또는 외부 공급 페이로드용 자리표시 |
|
전달체 클래스 / 서브타입 |
5 / 17 |
5 / 17 (변동 없음) |
VEHICLE_SUBCLASS L6290 - 매핑 20건이 서브타입 17종으로 해소 |
|
표적화 리간드 카탈로그 |
24 |
29 |
LIGAND_CATALOG L7249 |
|
카탈로그 설계 변이체 |
62 |
73 (카고·전달체 56 + 장기표적화 17) |
변이체 상수 L6177-L6311 |
|
발견 변이체 레지스트리 |
미보고 |
170 |
discovered_variants.json |
|
보관된 엔진 스냅샷 |
미보고 |
372 |
엔진 보관 디렉터리의 스냅샷 개수 |
표 1-1. v3.0 → v4.0 규모 변화. v4.0 수치는 전부 현재 코드에 대해 재측정했으며, 심사자가 신뢰하는 대신 직접 재현할 수 있도록 측정 근거를 병기했습니다.
이번 판의 성격을 규정하는 변화는 세 가지입니다.
레지스트리가 파이프라인의 입력이 아니라 산출물이 되었습니다. v3.0에서 플랫폼은 수작업으로 큐레이션한 62개 변이체 카탈로그를 순위화했습니다. 이제는 발견 루프가 기록하는 발견 변이체 레지스트리도 유지하며, 현재 170건이 들어 있습니다. 이 170건은 희망 목록이 아닙니다. 각 항목이 해소된 수용체, 헤드 서열과 토폴로지를 포함한 리간드 레코드, 장기 배정, 카고 배정을 함께 지닙니다. 분포 자체가 플랫폼이 실제로 어디에서 검증되었는지를 알려 줍니다 — 폐 128, 간세포 30, 뇌 7, 간 비-간세포 2, 종양 2, 간 1 — 그리고 이 분포를 평탄화하지 않고 보고합니다. 본 문서의 어떤 주장이 많은 실행에 근거하고 어떤 주장이 적은 실행에 근거하는지를 보여 주는 정직한 지도이기 때문입니다.
증거 계층이 물리 계층보다 빠르게 성장했습니다. 새로 추가된 약 15,000행 중 큰 부분은 새로운 물리가 아니라 새로운 판정입니다 — 수정이 그것에 의존하는 캐시된 소비자에게 실제로 도달하도록 하는 스키마 버전 캐시, 미측정 축이 조용히 통과 점수로 바뀌지 않게 하는 3상태 게이트, 낡은 결과가 최신 결과로 위장할 수 없게 하는 지문 검사입니다. 화려하지 않은 작업이고, 장시간 계산을 신뢰할 수 있는지를 결정하는 작업입니다. 9장이 그 상세입니다.
잠복 기능에 대한 정직성. 여러 기능이 배선되고 테스트되었으나 아직 어떤 실제 캠페인에서도 구동되지 않았습니다. 가장 분명한 예: 발견 변이체 170건 전부가 siRNA 카고이므로, 원형 자가증폭 RNA 경로는 구현·단위테스트되었음에도 실제 레지스트리 항목에서 한 번도 돌지 않았습니다. v3.0이라면 이 경로를 현재형으로 기술했을 것입니다. 본 판은 잠복으로 표시하고, 10.1절에 해당 사례를 전부 열거합니다.
결정성(Determinism). 규제 서류에 들어갈 수 있는 수치를 내는 도구는 두 번 물으면 같은 답을 해야 합니다. 모든 확률적 단계에 시드를 고정하며, 동일 입력 재실행은 모든 수치를 정확히 재현합니다.
추적성(Traceability). 모든 스테이지가 JSON 체크포인트를 디스크에 씁니다. 최종 순위 산출물의 어떤 값도 그것을 만든 정확한 스테이지·입력·모듈 버전까지 역추적할 수 있습니다. 이 설계의 목적은 심사자가 주장을 신뢰하는 대신 감사할 수 있게 하는 것입니다. v4.0은 이를 한 가지 방식으로 강화했습니다 — 체크포인트가 그것을 쓴 코드의 스키마 버전을 함께 지니므로, 폐기된 로직이 만든 캐시 값이 최신 값으로 다시 읽히지 않고 낡은 것으로 인식됩니다.
가산성(Additivity). 품질 계층의 어떤 모듈도 파이프라인을 게이트하지 않습니다. 통과/탈락 필터가 아니라 가산적 리스크 렌즈입니다. 중등도 니트로사민 플래그가 있는 입자를 조용히 버리지 않고, 그 부채를 정량화한 상태로 순위에 남기며, 절충 판단은 사람이 합니다.
우아한 성능 저하(Graceful degradation). 중량 물리 도구를 사용할 수 없으면 파이프라인이 멈추지 않고 해당 축을 '미판정'으로 표시하고 진행합니다. 미판정은 탈락과 다르며, 순위 산술에서 가중치 재정규화로 처리됩니다. 이 구분은 하중을 받는 구분입니다 — 둘을 뒤섞는 것이 스크리닝 파이프라인이 증거 부재를 통과 점수로 조용히 바꾸는 가장 흔한 경로입니다.
정직성(Honesty). 모든 모듈 출력이 명시적 유보 문구를 지닙니다. 생성되는 규제 문서는 측정으로만 확정되는 속성을 계산 대용값으로 조용히 채우지 않고 미해결 공백으로 표시합니다.
플랫폼의 범위는 두 축의 곱으로 정의됩니다 — 무엇을 전달할 것인가(카고 모달리티)와 무엇이 운반하는가(전달체 클래스). 업계 관행은 둘을 따로 최적화하지만 실제로 둘은 분리되지 않습니다. 화학적으로 많이 변형된 siRNA는 지질 조성 요구를 바꿉니다 — 2'-O-메틸과 포스포로티오에이트 치환이 이중가닥의 전하 밀도와 강성을 모두 바꾸므로, 이온화성 지질에 대해 얼마나 촘촘히 패킹되는지가 달라집니다. 큰 자가증폭 RNA는 짧은 이중가닥과 전혀 다른 입자 형태를 요구합니다 — 10 kb 단일가닥은 어떤 지질 비율에서도 21-mer 이중가닥과 같은 내부 구조에 수용될 수 없습니다. 플랫폼은 이 짝을 결합 최적화 문제로 다룹니다.
|
카고 클래스 |
설계 대상 |
주된 설계 난점 |
난점의 생물학적 이유 |
|
siRNA (이중가닥) |
가이드 선정, 화학 변형 패턴, 자가조립 접합체 구조 |
시드 기반 오프타깃 대 활성 |
온타깃 효력을 결정하는 7-뉴클레오티드 시드 영역이 동시에 miRNA 유사 오프타깃 억제를 일으키며, 서열 선택만으로 둘을 분리할 수 없습니다 |
|
ncRNAi |
비전형 RNAi 유도체 설계·변형 |
활성 모델의 외삽 리스크 |
활성 모델이 전형적 이중가닥으로 학습되어 있어 비전형 구조는 학습 분포 밖에 놓입니다 |
|
RNAa (유전자 활성화) |
프로모터 표적 소형 RNA 설계 |
활성화 방향성의 불확실 |
동일한 프로모터 표적 이중가닥이 크로마틴 맥락에 따라 활성화 또는 침묵을 유발하며, 어느 쪽인지 신뢰성 있게 예측하는 서열 특징이 없습니다 |
|
ASO 갭머 |
갭머 배치, 골격·당 화학 |
간독성과 PS 골격 단백질 결합 |
뉴클레아제 저항성을 부여하는 포스포로티오에이트 골격이 동시에 간세포 단백질에 무차별 결합해 클래스 간독성을 일으킵니다 |
|
SSO (스플라이스 전환) |
표적 스플라이스 부위 상보 서열 |
완전 변형 요구 / RNase H 회피 |
분자가 스플라이스 부위를 점유하면서 RNase H를 불러오지 않아야 하므로, 갭머를 작동시키는 화학을 의도적으로 배제해야 합니다 |
|
mRNA |
코돈 최적화, UTR, cap-1, poly(A), 뉴클레오시드 변형 |
길이 의존 가수분해 취약성 |
모든 뉴클레오티드 간 결합이 독립적 가수분해 표적이므로 완전성 손실이 전사체 길이에 비례하며, 4 kb mRNA는 1 kb보다 본질적으로 덜 안정합니다 |
|
saRNA (자가증폭) |
레플리콘 + 서브게놈 프로모터 + 카고 |
매우 큰 전사체의 캡슐화 |
레플리콘은 통상 mRNA보다 한 자릿수 길고, 전단되지 않고 입자로 접혀야 합니다 |
|
circRNA |
IRES + 리보자임 매개 원형화 |
백스플라이스 수율과 IRES 효율 |
원형화는 엑소뉴클레아제가 필요로 하는 자유 말단을 제거해 안정성을 얻지만, 그 뒤 cap 비의존 번역을 이끌어야 하는 IRES는 cap보다 훨씬 비효율적입니다 |
|
csaRNA (원형 자가증폭) |
레플리콘의 원형화 |
위 두 문제의 동시 발생 |
레플리콘의 크기 문제와 IRES의 번역 개시 손실을 함께 갖습니다 |
|
multiplex |
복수 페이로드 동시 제형화 |
비율 제어와 경쟁 |
한 입자 내 두 페이로드가 같은 내부 부피와 같은 탈출 사건을 두고 경쟁하므로, 전달된 비율은 제형화한 비율이 아닙니다 |
|
pDNA |
플라스미드 설계, 핵 진입 고려 |
막 하나가 아니라 둘을 통과 |
RNA와 달리 DNA는 추가로 핵에 도달해야 하며, 핵막은 엔도솜 탈출 기구가 다루지 않는 장벽입니다 |
|
RNP (편집 복합체) |
가이드 + 단백질 페이로드 제형화 |
접힌 단백질을 핵산과 함께 제형화 |
리보핵단백질은 크고 전하가 불균일하며 입체구조가 취약한 카고입니다. 핵산을 효율적으로 캡슐화하는 조건이 단백질을 변성시킬 수 있습니다 |
|
ssRNAi (단일가닥 RNAi) |
3' 단독 양친매성 앵커를 가진 단일 Ago2 탑재 가닥 |
패신저 가닥 없이 RISC 탑재 |
이중가닥은 Ago2에 미리 정렬된 가이드를 건네지만, 단일가닥은 스스로 탑재될 열역학적 능력이 있어야 하므로 변형 패턴 제약이 훨씬 엄격합니다 |
표 2-1. 치료 카고 모달리티 13종. 각각이 전용 Stage 0 설계기, 조립 규칙, 형태 기준, 특허 청구항 부분집합으로 라우팅됩니다. 마지막 열에 난점의 생물학적 기전을 적은 이유는, 플랫폼이 계산하는 설계 절충이 그 이유를 이해할 때만 의미를 갖기 때문입니다.
VALID_CARGO_TYPES (L6324)는 15개 항목을 등록합니다 — 위 13종에 generic(모달리티 미선언)과 custom_rnp, 즉 아래 2.1.1절에서 기술하는 단백질 페이로드 인계 슬롯입니다. CARGO_DEFAULTS (L6519)가 정확히 대응하는 15키를 지니므로 두 레지스트리가 일치합니다. 16번째 토큰 sgRNA는 독립 최상위 모달리티가 아니라 CRISPR 페이로드 경로의 하위 요소로만 나타납니다.
ssRNAi는 v3.0 이후 유일하게 새로 추가된 모달리티입니다. 두 변이체의 앵커가 의도적으로 다릅니다 — SR1은 C16 사슬로 문헌의 비제형 C16 접합 ss-siRNA 투여를 따르고, SR2는 자사 접합체 플랫폼이 쓰는 C24 앵커입니다. 올리고뉴클레오티드를 고정하고 앵커 길이만 바꾸는 것이 앵커의 기여를 교란 없이 귀속시키는 방법입니다.
단, 이 모달리티는 현재 수리 중입니다. 14.2절에 기술하듯 단일가닥 RNAi 하위 시스템에 실패 어서션 32건이 있고 원인이 스키마·중복 문제로 특정되었으나 해소되지 않았습니다. ssRNAi에 의존하려는 독자는 이 절을 먼저 읽어야 합니다. 다른 12종 모달리티는 이 군집의 영향을 받지 않습니다.
카고 패밀리는 열거하지 않고 파생합니다. 엔진이 이제 구조적으로 방지하는 결함 유형 하나를 기술할 값이 있습니다. mRNA 계열 — 단백질을 발현하므로 보관·선천면역·MHC 스캔 처리를 공유하는 카고 타입들 — 이 원래 {mRNA, saRNA, circRNA, multiplex}의 리터럴 복사본 4개로 작성되어 있었고, 모두 csaRNA가 존재하기 전에 쓰였으며 csaRNA가 추가될 때 아무것도 갱신되지 않았습니다. 직전 릴리스에서 측정된 결과: csaRNA가 6개 보관안정성 스테이지에서 −20 °C가 아니라 +5 °C 보관으로 배정되고, 선천면역 이중가닥 RNA 논거에서 누락되고, MHC-I 스캔이 '단백질 비코딩'으로 기록했습니다. 해결책은 패밀리를 열거하지 않고 파생하는 것이었습니다 — _EXPRESSING_CARGOS (L6602)는 예상 형태가 Bleb인 모든 카고로 계산되어 csaRNA를 포함한 5종을 자동으로 산출합니다 — 그리고 패밀리의 일부만 명명한 테이블을 보고하는 레지스트리 감사를 추가했습니다. 이것은 낡은 인덱스와 같은 실패 양상입니다. 이미 다른 곳에 존재하는 집합을 수작업 목록으로 유지하면 드리프트하고, 그 드리프트는 조용합니다.
등록된 카고 타입 15종 가운데 2종이 접힌 단백질을 운반하며, 둘은 같은 성격의 항목이 아닙니다. RNP은 고정 명세입니다 — 160 kDa SpCas9가 가이드 RNA와 복합체를 이루고, 단백질 물리화학량이 레지스트리에 상수로 고정되어 있습니다. custom_rnp은 자리표시가 아니라 인계 슬롯입니다. 단백질이 상위 단백질 설계 파이프라인에서 GeneCrafter.PayloadHandover/1 스키마로 설계 단위마다 공급되고, 제형은 SpCas9에서 물려받는 대신 그 특정 단백질로부터 다시 계산됩니다. 설계된 결합체·뉴클레아제·기타 조작 단백질이 미지원 페이로드가 아니라 제형화 가능한 페이로드가 되는 지점이 여기입니다.
무엇이 재계산되며 단백질이 왜 그 값을 움직이는가. payload_to_cargo_spec (L6654)은 페이로드의 분자량·등전점·pH 7.4 순전하·잔기 100개당 순전하를 받아 점수가 아니라 제형 명세를 반환합니다. 아래의 모든 값이 단백질의 존재 때문에 움직이며, 이것이 단백질 페이로드가 siRNA 기본값을 그대로 쓸 수 없는 이유입니다.
|
재계산 항목 |
단백질이 그 값을 바꾸는 이유 |
|
N/P 비 |
양전하 단백질이 핵산의 일부를 스스로 응축하므로 유효 인산 수가 줄고, 같은 전하 균형에 도달하는 데 필요한 이온화 지질이 줄어듭니다 |
|
혼합 pH |
등전점보다 1 단위 낮게 설정하고 3.5-5.5로 제한하므로, 단백질이 조립 중 순양전하를 유지하면서도 변성되는 pH로 끌려가지 않습니다 |
|
이온화 지질 pKa |
잔기 100개당 순전하로부터 6.2-6.8 구간에 매핑합니다. 양전하 페이로드는 복합체를 유지하는 데 지질의 도움을 덜 필요로 합니다 |
|
페이로드 유체역학 반지름 |
구형 폴드 가정으로 분자량에서 추정하며, 입자가 수용해야 하는 봉입 부피를 결정합니다 |
|
최소 코어 직경 |
단백질 부피와 가이드 RNA 부피의 합에서 유도합니다. 입자를 자기 내용물보다 작게 명세할 수는 없기 때문입니다 |
|
이온 강도 |
순전하 절댓값에 따라 50-300 mM로 조정합니다. 표면 전하가 클수록 콜로이드 안정성을 유지하는 데 더 많은 반대이온 차폐가 필요합니다 |
표 2-1b. custom_rnp 경로에서 설계 단위마다 재계산되는 단백질 페이로드 명세. 이 값들은 순위가 아니라 제형 레시피이며, 각 항목이 하위 빌드 스테이지에 대한 지시입니다.
목표 유체역학 직경은 이후 레지스트리 기본값과 계산된 최소 코어 직경 + 10 nm 가운데 큰 값으로 취합니다. 큰 설계 단백질이 입자 명세를 조용히 위반하는 대신 명세 자체를 넓히게 하는 장치입니다. apply_payload_handover는 결과를 CARGO_DEFAULTS['custom_rnp']에 병합하고 페이로드 식별자별로 기록하므로, 하위의 조대화 입자 빌드와 N:P 화학량론이 SpCas9 값이 아니라 해당 단백질의 값을 보게 됩니다. 인계 파일이 없거나 읽을 수 없는 경우는 조용한 기본값 적용이 아니라 무해한 무동작으로 처리되며, 런은 레지스트리 명세로 계속되고 그 사실을 기록합니다.
펩타이드는 의도적으로 카고 모달리티가 아닙니다. 이 구분은 추론에 맡기지 않고 명시할 값이 있습니다. 펩타이드는 한 계층 바깥, 즉 입자 표면의 표적화 헤드로 플랫폼에 들어옵니다. 리간드 카탈로그 29종 중 펩타이드 항목은 규칙 기반 생성기가 조대화 Martini 3 토폴로지로 구축하고, 상동체가 없는 de-novo 서열은 폴드를 예측하며, 펩타이드 헤드는 수용체 결합 도메인과 공동 폴딩하여 계면 신뢰도를 얻은 뒤에 채택됩니다. 펩타이드 치료제라면 전용 Stage 0 설계기, 조립 규칙, 형태 기준, 특허 청구항 부분집합이 필요하고 레지스트리는 그것을 주장하지 않습니다. 따라서 플랫폼의 펩타이드 처리를 보는 독자는 그것을 펩타이드 의약품 모달리티가 아니라 표적화로 읽어야 합니다.
|
클래스 |
등록 서브타입 |
이것이 정답인 경우 |
이유 |
|
LNP |
지질나노입자 계열(서브타입명이 아니라 조성으로 정의) |
mRNA, saRNA, circRNA, multiplex 편집 페이로드, ASO |
길고 가수분해에 취약한 전사체를 보호하면서 양성자 스펀지 탈출 기전을 제공하는 것은 캡슐화 입자뿐입니다 |
|
SAMiRNA™ (자가조립 접합체) |
특이성 계열과 고정화 계열의 접합체 구조 |
짧은 이중가닥과 단일가닥 올리고뉴클레오티드 |
21-mer 이중가닥은 캡슐화 외피가 필요 없습니다. 지질 접합 미셀이 더 작고 제조가 단순하며 이온화성 지질 독성 예산을 완전히 회피합니다 |
|
exosome |
6종: RVG, bare, 일반, milk, iRGD-Lamp2b, M1-대식세포 |
조성으로 도달할 수 없는 트로피즘, 경구 경로 |
생체막은 어떤 합성 이중층도 재현하지 못하는 천연 표면 단백질과 면역 회피 신호를 지닙니다 |
|
polymer |
변이체 8건이 6종으로: PLGA, PEI 폴리플렉스, PAMAM 덴드리머, PBAE, 키토산, PEG-PLA 미셀 |
지속 방출, 점막 경로, 비지질 내성 |
분해성 폴리에스터는 시간이 아니라 일 단위로 방출하고, 폴리플렉스는 지질 융합이 아니라 전하로 탈출합니다 |
|
VLP |
변이체 6건이 5종으로: MS2, Qbeta, eVLP-Gag, HBc, CCMV 식물유래 |
명확하고 단분산인 캡시드가 필요한 페이로드 |
캡시드는 크기가 하나인 단일 분자종이므로, LNP 방출 규격을 지배하는 다분산성이 제거됩니다 |
표 2-2. 전달체 카탈로그. VEHICLE_SUBCLASS (L6290)는 변이체→서브타입 매핑 20건을 보유하며 이것이 서브타입 17종으로 해소됩니다. 충돌은 의도적입니다 — 두 변이체가 서브타입을 공유하면서 조성이나 카고가 다를 수 있습니다.
다섯 중 셋 — exosome, polymer, VLP — 이 _NON_LNP_VEHICLE_CLASSES (L6428)로 묶인 이유는 정확히 지질나노입자 분자동역학 경로가 없기 때문입니다. 이 묶음은 분류학 연습이 아니라 실측된 실패 때문에 존재합니다 — mRNA를 운반하는 exosome 변이체가 mRNA-LNP 조대화 빌더로 라우팅되었고, 빌더가 그 변이체에게 존재하지 않는 이온화성 지질을 요구했습니다. 집합을 명시적으로 명명하는 것이 빌더 디스패치를 검사 가능하게 만듭니다.
변이체 로스터는 어떤 정적 목록보다 큽니다. ALL_VARIANTS (L6313)는 13개 패밀리 목록을 연결해 카탈로그 변이체 73종을 만듭니다 — 카고·전달체 변이체 56종 + 장기표적화 조성 변이체 17종. 그 위에 파이프라인이 discovered_variants.json에서 런타임 레지스트리(현재 170건)와 조직 조합 생성기를 읽어들입니다. 따라서 실제 로스터는 정적으로 결정 불가합니다 — 본 문서의 수치를 구동 중 인스턴스와 비교하는 독자가 더 큰 수를 보게 되므로 그 이유를 명시할 값이 있습니다.
리간드가 아니라 조성으로 하는 장기 표적화. 장기표적화 변이체 17종은 다섯 번째 하전 지질이 표적화 리간드 없이 트로피즘을 재지향하는 선택적 장기 표적화를 구현합니다. 전하 부호가 기전이고 레지스트리가 이를 기록합니다 — 폐 세트는 영구 양이온, 비장 세트는 음이온(포스파티드산·포스파티딜세린·포스파티딜글리세롤), 중추신경계 세트는 다시 영구 양이온입니다. 이 배후의 생물학은 수용체 인식이 아니라 코로나 조성입니다 — 양전하 표면은 음전하 표면과 다른 혈장 단백질 층을 모집하고, 내피가 읽는 것은 지질이 아니라 그 흡착된 층입니다.
이 영역의 한 세부 사항은 스크리닝이 얼마나 쉽게 자기를 속일 수 있는지를 잘 보여 줍니다. 여러 장기표적화 변이체가 서로 화학적으로 동일합니다 — 두 폐 변이체가 한 양이온성 지질을 공유하고, 두 비장 변이체가 한 음이온성 지질을, 두 CNS 변이체가 한 영구 양이온을 공유합니다 — 그리고 스테이지 1·2·8은 지질 구조만으로 키를 잡습니다. 방치하면 그 쌍들이 바이트 단위로 동일한 점수를 받고 같은 결과의 독립적 확증처럼 보이게 됩니다. _CHEM_DUPLICATE_GROUPS (L6473)가 그 묶음을 기록해 중복이 두 번 세어지지 않고 중복으로 인식되게 합니다.
LIGAND_CATALOG (L7249)는 29개 항목을 보유하며, 각각 수용체·장기·기준 해리상수·링커·문헌 인용을 지닙니다. 약 20종이 명시적 구조를 지니고, 일부 항체·Fab 헤드는 펩타이드 대용 자리표시 구조를 쓰며 이는 숨기지 않고 표시됩니다.
이 카탈로그의 설계는 틀리면 예측 효력을 수 자릿수 부풀리는 정량적 함정 하나를 드러내므로 기술할 값이 있습니다. 표준 간세포 리간드는 삼분지 당 클러스터로, 아시알로글리코단백질 수용체를 약 2.5 nM로 결합합니다. 그 수치는 삼가 클러스터의 값입니다. 당 단위 하나는 같은 수용체를 약 1 mM로 결합합니다 — 약 6자릿수 약합니다. 따라서 결합력(avidity) 모델은 삼가 수치를 일가 수치로부터 구성해야 합니다. 삼가 상수에서 출발해 다가 증강을 적용하는 모델은 클러스터 효과를 두 번 세기 때문입니다. 카탈로그는 두 상수를 나란히 저장해 유도가 조용히 잘못된 쪽에서 시작될 수 없게 합니다. 이 항목의 이전 개정판은 추가로 잘못된 당 — 포유류 수용체가 전혀 결합하지 않는 C4 에피머, 결합하는 렉틴은 조류 유래 — 을 담고 있어서 구조와 친화도 파라미터가 6자릿수 불일치한 상태로 각각은 그럴듯해 보였습니다.
리간드냐 조성이냐 — 플랫폼은 그 선택 자체를 순위화합니다. 간세포 표적에는 두 경로가 모두 존재합니다 — 통상 이온화성 지질이 아포지단백 E를 흡착해 저밀도지단백 수용체로 진입하는 수동 흡수, 그리고 당-수용체 경로를 통한 능동 표적화. 마우스 간세포 변이체는 의도적으로 수동 경로를 택하고 당 장식을 누락이 아니라 의도적 `None`으로 명시 기록합니다. 이유는 귀속성입니다 — 같은 입자를 두 기전으로 장식하면 한 실험에서 독립적인 간세포 흡수 경로가 둘이 되어 어느 쪽도 측정할 수 없게 됩니다. 이것은 ssRNAi 쌍의 단일 변수 원칙과 같은 규율입니다.
이 변이체 패밀리는 누군가 요청해서가 아니라 감사가 발견한 커버리지 공백 때문에 존재합니다. 카탈로그에 간세포 변이체가 35종 있었는데 그중 (LNP 운반체, siRNA 카고) 조합은 하나도 없었습니다. 모든 간 siRNA 항목이 접합체·폴리머·exosome이었고, 모든 간 LNP 항목은 mRNA·ASO·saRNA·circRNA를 운반했습니다. 이 분야에서 가장 당연한 질문 — 간을 겨냥한 통상 siRNA LNP — 을 표현할 변이체가 없었으므로 돌릴 것이 없었습니다. 카탈로그는 클 수 있고, 그러면서도 정확히 흔한 경우가 놓인 자리에 구멍이 있을 수 있습니다.
경로 선택은 장식이 아닙니다. 중심 물리화학 파라미터의 목표 창을 바꿉니다. 겉보기 pKa 최적값은 경로별로 저장되어 있습니다 (L10656) — 정맥 6.2-6.5, 근육 6.6-6.9, 피하 6.4-6.8, 흡입 6.6-7.0, 척수강내·안내·종양내 6.4-6.9. 이 창들이 다른 이유는 입자가 처음 만나는 pH와 단백질 환경이 다르고, 순환이 짧거나 없을 때 '순환에서 중성 유지'와 '도착 시 양성자화' 사이의 균형이 이동하기 때문입니다. 정맥 치료제에 최적인 지질은 근육 백신용으로는 측정 가능하게 준최적이며, 플랫폼은 실제로 선언된 경로의 창에 대해 점수를 냅니다.
종간 전환은 가정하지 않고 약동학 계층에서 명시적으로 처리합니다. 조성 기반 트로피즘 모델이 주로 설치류 생체 내 관찰로 학습되어 있고, 영장류·인간으로의 이행은 재학습된 인간 모델이 아니라 경로 의존 문헌 계수에 의한 전환이기 때문에 이 점이 중요합니다 [문헌 기준].
파이프라인의 제어 흐름은 정밀하게 기술할 값이 있습니다. 그 형태가 품질 계층을 게이트가 아니라 가산적으로 만드는 근거이기 때문입니다.
|
테이블 |
역할 |
|
STAGE_FNS (L22631) |
정수 부모 스테이지 9개, 0부터 8까지 |
|
POST_STAGE_HOOKS (L28292) |
하프스테이지 훅 76개. 부모 스테이지별로 키가 잡히고, 부모 직후 목록 순서대로 실행 |
|
SUBCOMMAND_STAGE_MAP (L29425) |
명령행 진입점 → 부모 스테이지 목록: design은 0-3, simulate는 4-5, score는 6-7, screen은 8, rank는 9 |
로스터 수준 순위 스테이지인 스테이지 9는 의도적으로 STAGE_FNS에 없습니다. 변이체 내부가 아니라 변이체 전체를 가로질러 동작하는 유일한 스테이지이므로 같은 변이체별 루프로는 스케줄될 수 없어 오케스트레이터에서 특수 처리됩니다.
체크포인트 식별자는 명시된 규약을 따릅니다 — 하프스테이지 id는 부모 id × 10 + 5입니다. 따라서 스테이지 3의 훅은 135, 스테이지 7의 훅은 175입니다. 이 오프셋은 하프스테이지 id가 부모의 정수 키와 절대 충돌할 수 없도록 존재합니다. 이후 훅들은 공식을 엄격히 재적용하는 대신 같은 블록을 확장해 번호를 받았으므로 id가 105부터 186까지 공백을 두고 이어집니다.
|
id |
명칭 |
계산 내용 |
|
0 |
페이로드 설계 |
모달리티별 카고·가이드 설계 |
|
1 |
지질 스크린 |
이온화성 지질 라이브러리 스크린과 형질도입 효율 예측 |
|
2 |
물리화학·독성 |
분자 기술자, 겉보기 pKa, 독성·면역원성·보체활성화 대용 지표, 그리고 유일한 하드 통과/탈락 판정 |
|
3 |
조대화 구축 |
조대화 시스템과 박스. 전달체 클래스·카고에 따라 5개 빌더 중 하나로 라우팅 |
|
4 |
생산 동역학 |
다일(multi-day) 분자동역학 구간 |
|
5 |
궤적 분석 |
캡슐화 효율, 형태, 두께·층상성, 사슬 규칙도, 확산, 표면적, 제타 전위 |
|
6 |
자유에너지 배터리 |
우산 샘플링 4구간: 수용체 친화도, 엔도솜 탈출, PEG 탈착, RNA-지질 회합 |
|
7 |
코로나·결합력 |
혈장 단백질 코로나, 다가 결합력, 공동접힘 기반 친화도 |
|
8 |
지식재산 필터 |
특허 청구항 그래프에 대한 FTO 판정 |
|
9 |
순위 |
로스터 수준 집계와 순위표 산출 |
표 3-1. 부모 스테이지 10개. 스테이지 2와 8만 게이트하며, 나머지 모두 가산적으로 기여합니다.
이 분포가 이 플랫폼이 실제로 무엇인지에 대한 가장 유용한 사실입니다.
|
부모 스테이지 |
하프스테이지 |
담당 |
|
8 (지식재산) |
42 |
약전·공정·안정성 계층 전체 |
|
7 (코로나·결합력) |
9 |
약동학, 용량 전환, 경로 흡수, 청소율, IVIVC, PEG 설계, 혈청 안정성, 다중단백 코로나, 전달 장벽 |
|
2 (물리화학) |
8 |
안전 QC, 안정성, 선천면역, 항-PEG, 지질 분해산물, 지질 상거동, 금속 촉매 분해 |
|
0 (페이로드) |
6 |
카고 검증, 변형 최적화, 접합체 구조 탐색, 파레토 탐색, 결합 섀도 최적화, 발현 제어 |
|
1 (지질 스크린) |
6 |
지질 컨포머, 조성 탐색, 스테롤 점수, 전달체 구조, QbD, 제형 |
|
6 (자유에너지) |
2 |
구간 병합, 탈출 동역학 |
|
3, 4, 5 |
각 1 |
원자 수준 역매핑, 수렴 검정, 엔도솜막 자유에너지 |
표 3-2. 하프스테이지 분포(총 76, POST_STAGE_HOOKS에서 부모별로 계수). 그중 42개가 지식재산 스테이지에 걸려 있고 물리 스테이지 3개를 합쳐 4개뿐이라는 것이 이 플랫폼의 정직한 형태입니다 — 서류가 덧붙은 분자동역학 패키지가 아니라, 물리 계층이 부착된 의사결정·품질 엔진입니다.
모든 스테이지가 변이체별로 JSON 파일 하나를 쓰며, 스테이지 이름으로 명명되어 해당 변이체 디렉토리에 저장됩니다. 쓰기는 UTC 타임스탬프를 찍고, 그 쓰기의 한 세부 사항이 의도적입니다 — 체크포인트를 재계산하지 않고 제자리에서 주석 추가할 때 원래 타임스탬프를 보존합니다. 타임스탬프를 전진시키면 주석 추가된 체크포인트가 그것으로부터 파생된 결과보다 새것으로 보여 출처 순서가 역전되기 때문입니다.
재개 적격성은 블랙리스트가 아니라 화이트리스트입니다 — ok와 skipped만 재사용을 허용합니다. 그 외 전부 — partial, stub, pending, error, 그리고 코드가 인식하지 못하는 모든 상태 — 는 재실행을 강제합니다. 여기서 화이트리스트가 옳은 선택인 이유는, 인식되지 않는 상태가 새로운 성공 양상이기보다 새로운 실패 양상일 가능성이 훨씬 높기 때문입니다.
이것을 잘못했을 때의 결과가 코드에 기록되어 있습니다. dry-run 모드가 한때 자기 체크포인트를 썼고, 그 dry_run 레코드 2,030건이 상태 집계를 오염시켰을 뿐 아니라 재개 분기가 그것들을 정당한 결과로 되읽어 실제 결과를 파괴했습니다. 이제 dry-run은 결과를 쓰지 않고 반환합니다.
이 부분이 보고서의 수치가 정말 그것을 만들었다고 주장하는 코드에 의해 산출되었는지를 가장 직접적으로 결정하므로 따로 다룹니다. 연속된 두 릴리스가 교훈적인 방식으로 이를 틀렸습니다.
스테이지의 캐시 키는 지문(fingerprint)으로, 지문 형식 버전, 스테이지·카고 정체성, 스테이지가 실제로 실행하는 각 외부 래퍼 스크립트의 내용 해시, 그 변이체 자신의 레지스트리 행에 대한 변이체별 해시, 유전자 기호가 아니라 입력 서열의 해시, 스테이지별 참조 데이터 버전으로 구성됩니다. 레지스트리 해시를 변이체별로 한정한 것은 의도적입니다 — 한 변이체의 규격을 수정했다고 다른 모든 변이체의 캐시된 작업이 무효화되어서는 안 됩니다.
첫 번째 실패. 한 릴리스에서 수리된 다섯 스테이지가 지문을 전혀 갖고 있지 않았습니다. 지문이 없으면 최신성 검사가 실패할 수 없으므로, 이전 릴리스가 쓴 체크포인트 860건이 그대로 되읽혔고 — 그 릴리스의 수리된 코드는 단 하나의 변이체에서도 실행되지 않았을 것입니다. 아무것도 에러를 내지 않았고, 실행은 그저 옛 수치를 보고했습니다.
바로 다음 릴리스의 두 번째 실패가 더 흥미롭습니다. 수정이 목표 6개 스테이지 중 5개에 도달했습니다. 여섯 번째를 놓친 이유는 그 스테이지의 변경된 로직이 외부 래퍼 스크립트가 아니라 모듈 내부 함수였고, 지문은 래퍼만 해시했기 때문입니다. 찾아보자 증거는 명백했습니다 — 목표 변이체 6개 전부가 ok로 표시된 체크포인트를 지문 키 없이 보유하고 있었고, 현재 코드가 다른 값을 계산하는 자리에 폐기된 값을 담고 있었습니다.
코드가 이제 명시하는 일반화는 캐시를 가진 어떤 단계적 파이프라인에도 적용되므로 원칙으로 인용할 값이 있습니다 — "어떤 캐시를 무효화해야 하는가"는 본문이 편집된 스테이지를 열거해서가 아니라, 변경된 심볼을 그것의 캐시된 소비자까지 추적해서 답한다. 공유 상수나 모듈 내부 보조 함수는 자기 스테이지가 없으므로, 편집된 스테이지를 세는 방식은 매번 그것을 놓칩니다.
현행 릴리스가 이를 다시 확장했습니다. 한 활성 모델이 평범한 파이썬 임포트 4단을 거쳐 어느 스테이지에 도달하는데 어떤 지문도 그것을 덮지 않았고, 이제 그 모델의 해시가 키의 일부입니다. 결과는 숨기지 않고 코드에 명시되어 있습니다 — 체크포인트 184건이 재실행되고 그 수치가 움직일 것입니다. 수정이 결과를 바꾼다는 사실을 공표하는 것은 안심시키는 것의 반대이며, 그것을 보고하는 유일하게 정직한 방법입니다.
한 안전 속성은 프로그램이 기동을 거부하는 방식으로 강제됩니다. 지문을 가진 스테이지 집합과 고비용으로 분류된 스테이지 집합은 서로소여야 하며, 교집합이 비어 있지 않으면 임포트 시점에 예외가 발생합니다.
이유는 구체적입니다. 지문 불일치가 캐시를 무효화할 때, 무효화 분기는 버려지는 작업이 저렴한지 고비용인지 확인하지 않고 삭제·재계산합니다. 이것은 어떤 고비용 스테이지도 지문을 갖지 않기 때문에만 안전합니다. 만약 궤적 분석 스테이지에 지문이 추가되면, 이 엔진 파일을 편집할 때마다 다일 시뮬레이션 결과를 조용히 폐기하기 시작할 것입니다. 이 위험을 주석으로 문서화하는 대신 코드가 불변식을 단정하고, 미래의 변경이 이를 깨면 크게 실패합니다.
세 실행 모드가 공존합니다. 스레드 풀이 생산 동역학 스테이지 내부 동시성을 담당합니다. 프로세스 풀이 변이체 수준 동시성을 담당하지만 명시적으로 병렬 안전으로 표시된 6개 스테이지에만 적용됩니다 — 페이로드 설계, 지질 스크린, 물리화학, 궤적 분석, 코로나, 지식재산 필터. 그 외 전부 순차 실행입니다. 박스 패킹은 변이체별이 아니라 구축 스테이지 후 전역으로 한 번 실행되는데, 패킹 결정이 상호작용하기 때문입니다.
이 화이트리스트는 보이는 것보다 중요합니다. 스테이지가 병렬 안전한 것은 공유 상태를 변경하지도 단일 가속기를 경합하지도 않을 때뿐이고, 목록에 없는 스테이지의 기본값은 순차 실행입니다. 고비용 스테이지가 수 기가바이트 궤적을 쓰는 파이프라인에서 안전을 기본값으로 두고 명시적으로 옵트인하는 것이 올바른 방향입니다.
본 장은 플랫폼의 계산 엔진을 기능 계약으로 열거합니다. 각 항목은 무엇을 소비하고 무엇을 산출하는지로 정의되며, 구현 백엔드는 명시하지 않습니다. 이것은 마케팅적 은폐가 아니라 아키텍처적 사실입니다 — 모듈은 계약이 유지되는 한 교체 가능하도록 설계되었고, 실제로 개발 중 여러 모듈이 상·하류 코드 변경 없이 백엔드를 교체했습니다.
GC-계열 어휘는 v3.0에서 변경하지 않았습니다. 의도적입니다. 고객 대면 모듈명은 인터페이스이고, 판(edition)마다 인터페이스를 개명하면 그것을 인용하는 모든 문서·프로토콜·보고서가 깨집니다. 변경된 것은 여러 모듈 배후의 하프스테이지 기구이며, '구동 위치' 열이 각각이 이제 어디서 도는지를 명시합니다.
|
모듈 |
입력 |
출력 |
구동 위치 |
|
GC-CARGO |
표적 유전자 또는 사용자 서열, 카고 클래스 |
모달리티 완결 서열 (해당 시 UTR, cap, poly(A), 레플리콘, IRES) |
스테이지 0 |
|
GC-CHEMOPT |
가이드 후보군, 모달리티 |
위치별 당·골격 변형 패턴과 활성·안정성·면역원성 점수 |
하프스테이지 106 |
|
GC-STRUCTSEARCH |
접합체 자유도 (지질 × PEG 분자량 × 표적화 헤드 × 결합가) |
최적 자가조립 미셀 구조 |
하프스테이지 107 |
|
GC-PARETO |
화학 격자 × 구조 격자, 목적함수 4-6개 |
비지배 파레토 프론트와 초부피 커버리지 지표 |
하프스테이지 170 |
|
GC-CRISPRPAY |
표적 게놈, 뉴클레아제 모달리티 |
오프타깃 스크리닝된 스페이서와 스캐폴드 폴딩 검증 |
스테이지 0 |
v3.0 이후 이 패밀리의 신규 사항: 발현 제어 훅(172)과 결합 섀도 최적화 훅(171). 후자가 이번 릴리스에서 활성 모델이 캐시 키에 포함되어 수치가 움직이는 스테이지입니다.
|
모듈 |
기능 |
구동 위치 |
|
GC-LIPIDSCORE |
이온화성 지질 구조 → 형질도입 효율, 유체역학적 직경, 다분산도 (다중 모델 앙상블) |
스테이지 1 |
|
GC-LIPIDGEN |
목표 겉보기 pKa를 조건으로 한 프래그먼트 조립 기반 de-novo 이온화성 지질 생성 |
스테이지 1, 선택 |
|
GC-PKA |
조립 입자의 겉보기 pKa를 자기일관 표면전위 문제로 해결 |
스테이지 2 |
|
GC-QSARGATE |
물리화학·독성·선천면역원성 대용 지표. 유일한 하드 게이트 적용 |
스테이지 2 |
|
GC-COMPOSE |
지질 몰비 심플렉스 × 다섯 번째 장기표적화 지질 × PEG 분자량 탐색 |
하프스테이지 108 |
|
GC-STEROL |
스테롤 라이브러리에 대한 구조 지질 최적화 (트로피즘, 탈출, 패킹 창) |
하프스테이지 130 |
|
GC-PEGX |
목표 트로피즘에 맞춘 PEG-지질 밀도 × 분자량 × 앵커 탈락 동역학 최적화 |
하프스테이지 158 |
|
GC-VEHICLE |
비지질 전달체 클래스 선택과 물리 설계공간 최적화 |
하프스테이지 156 |
|
GC-LIGAND |
표적화 리간드 카탈로그 조회, de-novo 생성, 표면 밀도 최적화 |
스테이지 0 / 1 |
|
GC-CONJUGATE |
제형 후 표면 접합 화학: 효율, 달성 밀도, 청소율 절충 |
부속 진입점 |
이 패밀리의 신규 구동 위치: 지질 컨포머 훅(115), 지질 상거동 훅(157), 금속 촉매 분해 훅(159).
|
모듈 |
기능 |
구동 위치 |
|
GC-CGBUILD |
카고 인식 조대화 구축: 지질·핵산·PEG·스테롤 배치, 카고 비례 박스 스케일링, 충돌 해소 |
스테이지 3, 빌더 5종 |
|
GC-MDCORE |
최소화, 단계적 평형화, 생산 동역학 (다중 시드, 청크, 재시작 간 재개 가능) |
스테이지 4 |
|
GC-TRAJ |
캡슐화 효율, 형태 분류, 구조 관측량 |
스테이지 5 |
|
GC-SATURATE |
관측량 시계열의 자기상관 보정 포화 검정. 적응적 조기 정지 구동 |
하프스테이지 179 |
|
GC-PMF |
재가중 적분을 포함한 우산 샘플링 자유에너지 4구간 |
스테이지 6 |
|
GC-MEMPMF |
엔도솜막 삽입 자유에너지 (pH 스위치 분해) |
하프스테이지 155 |
|
GC-BACKMAP |
조대화 → 원자 수준 역매핑과 선택적 온도 래더 상전이 추정 |
하프스테이지 178 |
|
모듈 |
기능 |
구동 위치 |
|
GC-CORONA |
경쟁적 아포지단백/알부민/옵소닌 흡착 추정과 다가 결합력 |
스테이지 7 + 하프스테이지 176 |
|
GC-TROPISM |
조성 그래프 장기 트로피즘 예측, 설치류→영장류·인간 전환 |
스테이지 7 |
|
GC-PBPK |
3구획 생체분포, 경로별 흡수, 종간 용량 전환, 표적 점유 약력학 |
하프스테이지 175 |
|
GC-ESCAPE |
이온화 균형·보조지질 융합성·양성자 스펀지 완충을 결합한 엔도솜 탈출 효율 지수 |
하프스테이지 174 |
|
GC-KNOCKDOWN |
전달 후 표적 녹다운·회복 동역학, 반복투여 스케줄 포함 |
부속 진입점 |
신규 구동 위치: 전달 장벽 훅(186). 주사 부위에서 세포질까지의 물리적 장벽을 단일 생체이용률 항에 암묵적으로 두는 대신 명시화합니다.
|
모듈 |
기능 |
구동 위치 |
|
GC-CMC |
약전·공정·안정성 계층 — 지식재산 부모에 걸린 하프스테이지 42개 (6장이 그 상세) |
부모 8의 하프스테이지 |
|
GC-DOSSIER |
예측·기지 중요품질특성을 규격표와 공백 보고서로 집계 |
하프스테이지 129 |
|
GC-QBD |
중요공정파라미터 → 중요품질특성 매핑, 설계공간 경계, 설정점 강건성 |
하프스테이지 111 |
|
모듈 |
기능 |
구동 위치 |
|
GC-FTO |
부분구조 규칙·RNA 모티프·조성비·지문 유사도에 의한 FTO 스크리닝 |
스테이지 8 |
|
GC-RANK |
채점 축의 가중 융합, 최약링크 게이팅, 실패양상 비상관 패널 선정 |
스테이지 9 |
|
GC-UQ |
증거량에 비례하는 신용구간 전파 |
스테이지 9 |
|
GC-LEARN |
습식 실험 피드백 수용, 베이지안 사후분포 갱신, 차기 배치 제안 |
부속 진입점 |
|
GC-HANDOFF |
변이체별 습식 실험 패키지, 플레이트 맵, 합성 주문서 산출 |
스테이지 9b / 9.5 |
|
GC-DISCOVER |
표적 조직 → 농축 수용체 → 리간드 → 신규 변이체 자동 발견 루프 |
전 구간 |
GC-BRIDGE는 다른 설계 파이프라인이 상류에서 확정한 페이로드 — 편집 효소 리보핵단백, 항체, de-novo 단백질 — 를 받아 전달 문제로 재구성합니다. 인바운드 계약이 임시 딕셔너리가 아니라 명명된 버전 스키마이며, 이것이 상류 파이프라인이 진화하면서도 이쪽을 깨지 않게 하는 근거입니다. 이 브리지를 통해 페이로드 자체의 개발성 점수와 항약물항체 리스크가 전달체 순위에 직접 유입되고, 특히 강한 양이온성 지질이 면역증강제로 작용해 그 항약물항체 리스크를 증폭하는 효과가 유보 문구가 아니라 정량적으로 계산됩니다.
예측값은 그것이 어떤 물리량을 추정하는지, 어떤 근사가 그것을 만들었는지, 어떤 생물학이 그것을 중요하게 만드는지를 독자가 알 때만 유용합니다. 그래서 본 장은 기능 목록보다 깁니다. 각 절이 기전 → 계산 → 정직한 한계 순으로 서술됩니다.
생물학. 이온화성 지질은 두 순간에 서로 다른 두 분자여야 합니다. pH 7.4 혈중에서는 본질적으로 하전되지 않아야 합니다 — 양전하 입자 표면은 보체와 면역글로불린을 결합하고 보체 캐스케이드를 활성화해 수 분 내 제거되며, 접촉하는 적혈구 막을 용혈시킵니다. 엔도솜 내부, 양성자 펌프가 내강을 pH 6.5에서 5.5를 거쳐 5.0으로 끌어내리는 그곳에서 같은 지질은 상당히 양전하를 띠어야 합니다 — 양성자화가 엔도솜막의 음이온성 인지질과 짝을 이루고, 이중층을 불안정화하는 역육방(inverted-hexagonal) 접촉을 형성하고, 페이로드를 세포질로 방출하게 하는 조건이기 때문입니다. 이 분자의 임무는 약 2 pH 단위의 차이를 감지해 그 경계에서 전하 상태를 바꾸는 것입니다.
그래서 겉보기 pKa가 지배적인 단일 설계 파라미터입니다. 조립된 입자 표면에서 이온화성 기의 절반이 양성자화되는 pH이고, 엔도솜 산성화 궤적의 어디에서 스위치가 넘어가는지를 결정합니다. 너무 낮으면 지질이 탈출에 필요한 만큼 양성자화되지 않습니다 — 입자는 흡수되어 리소좀까지 이동하고, 페이로드는 온전하지만 무의미한 상태로 분해됩니다. 너무 높으면 지질이 이미 혈장에서 양전하이고, 입자는 흡수될 만큼 오래 생존하지 못합니다.
조립 입자 값이 분자 값이 아닌 이유. 희석 용액 속 고립 지질 분자의 pKa를 측정하거나 계산하는 것은 틀린 질문에 답하는 것입니다. 입자 표면에서 이온화성 기는 고밀도로 패킹되어 있고, 각 양성자화가 국소 표면전위를 올려 다음 양성자화를 더 어렵게 만듭니다. 이 효과는 크고 — 통상 1 pH 단위 이상 — 잡음이 아니라 계통적입니다. 따라서 플랫폼은 겉보기 pKa를 자기일관 정전기 문제로 다룹니다: 표면전위가 pKa를 이동시키고, 이동된 pKa가 양성자화 정도를 바꾸고, 바뀐 양성자화가 표면전위를 바꿉니다. 지배 관계식은 고유값에 대한 표면전위 보정 pKa_app = pKa_intrinsic - F*psi/(2.303*R*T)이며, 한 번 적용하지 않고 자기일관까지 풉니다.
고유값 자체는 지원 도구가 있으면 구조 기반 계산에서, 없으면 pKa ~ 6.5 + 0.10*logP - 0.01*TPSA 형태의 기술자 회귀에서 얻습니다. 어느 경로를 썼는지가 값과 함께 출력에 기록됩니다. 두 경로의 불확실도가 매우 다르고, 둘을 구별할 수 없는 독자는 올바르게 가중할 수 없기 때문입니다.
경로 의존성. 목표 창은 단일 수치가 아니라 경로별 대역입니다 (L10656) — 정맥 6.2-6.5, 근육 6.6-6.9, 피하 6.4-6.8, 흡입 6.6-7.0, 척수강내·안내·종양내 6.4-6.9. 정맥 창이 가장 낮고 좁은 이유는, 정맥 입자가 흡수되기 전에 완전한 순환 통과를 생존해야 하므로 혈장에서 양전하인 것의 벌점이 최대이기 때문입니다. 근육 백신 입자는 조직에 주사되어 수 분 내 국소 흡수되므로 약간 양전하인 비용이 훨씬 작고, 더 높은 창이 더 나은 탈출을 사 줍니다. 따라서 지질을 잘못된 경로의 창에 대해 채점하는 것은 반올림 오차가 아니라 순위를 역전시킬 수 있는 오류입니다.
측정 가능하므로 명시하는 정직한 한계. 엔진은 예측 pKa가 5.0-8.0 밖이면 탈락시키는 하드 안전 게이트도 적용합니다. 현재 라이브러리 값이 약 6.44-6.86에 분포하므로, 이 게이트에 대해 측정하면 모든 후보를 통과시키며 판별력이 0입니다. 이것은 스크린이 아니라 심하게 잘못된 예측에 대한 보호장치로 유지되며, 후보가 pKa로 걸러졌다는 증거로 인용해서는 안 됩니다. 판별 작업은 경로 대역 밖 1 pH 단위에서 0으로 선형 감쇠하는 연속 창 적합도 항이 수행합니다.
생물학. 캡슐화 효율은 표면에 흡착되지 않고 입자 내부에 격리된 페이로드 분율입니다. 표면 결합 RNA는 단순히 낭비가 아닙니다 — 혈청 뉴클레아제에 노출되고, 세포외 핵산을 감지하는 패턴인식수용체에 이용 가능하며, 전달 용량에 기여하지 않으면서 측정 페이로드 농도에는 기여합니다. 캡슐화 95%인 제형과 70%인 제형이 총 RNA로는 동일하게 정량되면서 효력은 수 배 차이날 수 있습니다.
계산. 결합 분석으로 캡슐화를 추정하는 대신, 플랫폼은 시뮬레이션된 입자에서 기하학적으로 측정합니다 — 용매로부터 5 Å 이내에 놓인 페이로드 비드 분율이 노출 분율이고, 캡슐화는 그 여수(complement)입니다. 이것은 상관이 아니라 정의이며, 그것이 강점입니다 — 염료의 접근성이나 소광 효율에 의존하지 않습니다. 동시에 한계이기도 합니다 — 5 Å 임계값은 '표면'이 어디서 시작하는지를 정하는 모델링 선택입니다.
이것이 계산 가능해지려면 명명할 값이 있는 공학적 결정이 하나 필요했습니다. 실행 가능한 분석과 불가능한 분석을 가르는 차이이기 때문입니다. 큰 입자에서 페이로드와 용매 비드 간 전쌍 거리를 순진하게 계산하면 프레임당 수백 기가바이트를 할당합니다. 따라서 분석은 공간적으로 상한이 걸린 이웃 탐색을 사용해 절단거리 내 쌍만 반환하고 전체 행렬을 실체화하지 않습니다.
내부 형태. 플랫폼은 내부 구조도 분류하며, 그 분류는 생물학적으로 중요합니다. 전자밀도가 높은 내부 하부구조 — bleb 형태 — 는 극저온전자현미경에서 더 높은 발현과 상관되고, 엔진은 정확히 단백질을 발현하는 카고 타입들의 예상 형태로 그것을 사용합니다. 이 결합은 이제 카고 이름의 수작업 목록이 아니라 형태 기대값에서 파생되며, 그것이 2장의 패밀리 드리프트 결함을 고친 방식입니다.
보조 관측량이 같은 궤적에서 계산됩니다 — 이중층 두께와 층상성; 조대화 꼬리 결합 벡터에 대해 전역 축이 아니라 국소 반경 법선을 기준으로 측정한 사슬 규칙도 P2 = (3*cos^2(theta) - 1)/2 (곡면에 대한 올바른 기준이며, 이후 중수소 규칙도 관례로 변환); 탄도적 초기와 표본이 빈약한 말단을 모두 피해 곡선 중간 구간에 아인슈타인 적합을 적용한 측방 확산; 피보나치 구면 위 Shrake-Rupley 구성으로 계산한 페이로드 용매접근가능표면적; 전하 분포로부터의 제타 전위.
제타 계산의 한 세부 사항은 코드가 숨기지 않고 문서화한 함정의 좋은 예입니다. 조대화 역장은 반작용장 유전율 15로 동작하는데, 이는 시뮬레이션의 모델링 파라미터이고 물의 성질이 아닙니다. 전하를 전위로 변환하는 해석적 정전기는 물의 실제 비유전율 약 78을 써야 합니다. 시뮬레이션의 15를 조용히 재사용하면 계산된 모든 전위가 약 5배 부풀려지며, 코드는 그 때문에 두 상수를 명시적으로 구별합니다.
전달 모델을 지질 모델과 구별하는 지점 — 같은 지질 조성이 다른 페이로드 주위에서 같은 입자를 만들지 않습니다. 엔진은 시뮬레이션 박스를 페이로드 길이에 따라 box_nm = min(120, max(30, 30*(cargo_nt/1500)^0.42))로, 30-120 nm 범위에서 스케일합니다.
준선형 지수가 물리적으로 의미 있는 부분입니다. 응축 입자 내 유연 폴리음이온은 길이에 비례하는 부피를 점유하지 않습니다. 약 1/2 거듭제곱에 가까운 부피를 점유하는데, 코일을 이루기 때문이고 응축 지질이 유효 지속길이를 줄이기 때문입니다. 지수 0.42는 10배 긴 전사체가 10배가 아니라 약 2.6배 큰 박스를 필요로 한다는 것을 인코딩합니다. 선형 스케일을 쓰면 시뮬레이션 부피의 두 자릿수를 용매에 낭비하고, 고정 박스를 쓰면 큰 전사체가 자기 주기영상에 잘려 허위 형태를 만듭니다.
전하비 요구도 같은 근거로 카고 클래스에 따라 스케일하며, 레지스트리가 카고별로 기록합니다 — 짧은 올리고뉴클레오티드 클래스는 질소/인 비 1, 통상 mRNA·원형 RNA·multiplex는 6, 자가증폭 RNA와 플라스미드 DNA는 8, 가장 길고 구조화된 카고인 원형 자가증폭 RNA는 9. 더 길고 더 많이 하전된 페이로드는 응축에 비례적으로 더 많은 이온화성 질소를 필요로 하며, 이를 부족하게 공급하는 것이 페이로드를 표면에 남기는 원인입니다.
전달은 네 분자 사건에서 성공하거나 실패하며, 각각은 구조에서 읽어낼 수 있는 속도가 아니라 자유에너지 차이입니다. 플랫폼은 반응좌표를 따른 편향 샘플링으로 네 개를 모두 계산합니다.
|
구간 |
물리적 사건 |
효력을 지배하는 이유 |
|
수용체 회합 |
리간드-수용체 결합 |
능동 표적화 입자의 흡수 속도를 결정. 수동 입자에서는 코로나 조성이 같은 역할 |
|
엔도솜 탈출 |
양성자화된 지질의 엔도솜막 삽입 |
사실상 모든 승인 핵산 LNP의 속도결정 단계. 널리 인용되는 추정은 탈출 효율을 한 자릿수 퍼센트대로 두므로, 용량 대부분이 여기서 손실됩니다 |
|
PEG 탈착 |
입자 표면에서 PEG-지질 탈락 |
PEG를 전혀 벗지 않는 입자는 안정하지만 필요한 코로나로부터 입체 차단되고, 너무 빨리 벗으면 순환 중 응집합니다 |
|
RNA-지질 회합 |
운반 지질로부터 페이로드 방출 |
엔도솜을 탈출해도 페이로드가 운반 지질에 붙어 있으면 무의미합니다 |
표 5-1. 자유에너지 배터리 4구간. 박스에 수용체가 없으면 수용체 구간은 명시적으로 건너뛰며, 계산되지 않은 값을 0으로 채우지 않습니다.
방법과 파라미터. 각 구간은 우산 샘플링입니다 — 시스템을 좌표를 따라 여러 위치에 구속하고 편향된 분포를 결합해 자유에너지 프로파일을 만듭니다. 주 배터리는 2.0-4.1 nm를 균일 0.3 nm 간격 8창으로 쓰며, 구속 강성은 구간별로 선택됩니다 — 엔도솜 삽입 1000, 수용체 회합 1500, RNA-지질 분리 2000 kJ/mol/nm². 강성이 다른 이유는 배후 프로파일의 기울기가 다르기 때문입니다 — 비편향 힘이 큰 곳에는 더 강한 구속이 필요하고, 그렇지 않으면 창의 표본 분포가 이웃과 겹치지 않습니다. 막 삽입 배터리는 더 촘촘하고 긴 좌표 — 0-6 nm를 0.25 nm 간격 24창 — 를 쓰는데, 계면 흡착 최소점과 중앙 장벽을 모두 분해해야 하기 때문입니다.
구현에 관한 투명성 고지 하나. 프로파일 적분은 통상의 가중 히스토그램 유틸리티 호출이 아니라 평균힘에 대한 직접 구현 우산 적분입니다. 이유가 코드에 문서화되어 있습니다 — 여기서 쓰는 편향 경로가 그 유틸리티가 읽는 pull-force 파일을 산출하지 않으므로 원래 호출은 죽은 코드였고 조용히 아무것도 만들지 않았습니다. 함수명에는 예전 용어가 남아 있으며 이는 거동 부채가 아니라 명명 부채입니다. 출력을 검사하는 독자가 표준 도구가 돌았다고 합리적으로 오인할 수 있으므로 여기 기록합니다.
자유에너지에서 보고 수치로. 수용체 구간은 Kd = exp(-|dG|/RT)로 해리상수로 변환됩니다. 이 변환이 유보가 붙어야 할 지점입니다 — 값은 표준상태 보정 없이 상대값으로 계산되므로 변이체 간 순위 비교에는 유효하고 절대 친화도로 인용해서는 안 됩니다.
탈출 지수는 단일 적합 점수가 아니라 의도적으로 세 항의 곱입니다. 세 항이 독립적인 물리 요구를 기술하고, 어느 하나의 실패를 다른 둘이 보상할 수 없기 때문입니다.
첫째는 이온화 균형입니다 — 겉보기 pKa가 주어지면 헨더슨-하셀바흐 계산이 엔도솜 pH에서 양성자화된 지질 분율을 줍니다. pKa 설계 작업이 겨냥하는 항입니다.
둘째는 보조지질 융합성입니다. 양성자화만으로 막이 재구성되지는 않습니다. 조성이 비층상 기하를 채택할 수 있어야 합니다. 원뿔형 불포화 포스파티딜에탄올아민은 음의 자발 곡률을 가져 이중층을 뚫는 역육방 접촉을 촉진하고, 원통형 포화 포스파티딜콜린은 안정한 층상으로 패킹되어 저항합니다. 엔진이 보조지질별 융합성 가중치를 지닌 이유이며, 그 결과 절충은 실재합니다 — 탈출을 개선하는 융합성 보조지질이 동시에 저장수명을 단축하는 산화 가능한 지질입니다.
셋째는 완충 용량, 즉 양성자 스펀지 기여입니다. 적정 가능한 아민이 여러 개인 지질은 엔도솜이 산성화될 때 양성자를 흡수하여 반대이온·물 유입을 유도하고 막에 삼투 스트레스를 가합니다. 엔진은 이 항에 적정 가능한 질소만 세고 총 질소를 세지 않습니다 — 아미드 질소는 분자량에 기여하고 완충에는 기여하지 않으므로, 둘을 뒤섞으면 효과가 과대평가됩니다.
셋을 곱하는 것이 생물학을 올바르게 인코딩합니다 — 완벽히 조정된 pKa도 강직하게 층상인 조성에서는 탈출이 나쁘고, 고도로 융합성인 조성도 지질이 양성자화되지 않으면 마찬가지입니다.
생물학. 혈중 진입 수 초 내에 나노입자는 혈장 단백질로 덮이고, 그 순간부터 몸이 읽는 생물학적 정체성은 지질이 아니라 코로나입니다. 가장 분명한 입증은 간세포 전달입니다 — 통상 이온화성 LNP가 간세포에 도달하는 이유는 저밀도지단백 수용체의 리간드인 아포지단백 E를 흡착하기 때문입니다. 입자는 표적화된 것이 아니라 표적화 상호작용으로 옵소닌화된 것입니다. 예컨대 PEG 밀도를 올려 그 흡착을 제거하면, 지질에 관해 아무것도 변하지 않았는데도 간 전달이 떨어집니다.
장기표적화 조성 변이체가 리간드 없이 작동하는 이유도 이것입니다. 표면 전하를 바꾸면 흡착되는 혈장 단백질이 바뀌고, 주어진 장기의 내피가 인식하는 것은 그 흡착된 집합입니다.
계산, 그리고 의도적으로 하지 않는 일 하나. 엔진은 아포지단백·알부민·옵소닌의 경쟁적 흡착을 추정하고 다가 결합력 모델과 결합합니다. 아포지단백 항은 체류시간에 따라 1 - exp(-1/tau)로 포화하며, 이는 흡착이 노출에 선형이 아니라 빠르고 자기제한적임을 인코딩합니다.
거부하는 부분이 강조할 지점입니다. 알부민·옵소닌 항은 PEG 표면 밀도와 제타 전위가 둘 다 존재하고 유한할 때만 계산됩니다. 어느 하나가 없으면 모듈은 기본값·평균·0을 대입하지 않고, 누락 입력 목록과 함께 명시적 unscored 상태를 산출하며, 순위 계층이 그 축을 재정규화로 제외합니다. 누락값을 수치로 강제 변환하는 것을 거부하는 수치 가드가 이를 위해 따로 존재합니다.
작은 설계 선택처럼 들리지만 본 장에서 가장 결과가 큰 선택입니다. 누락 코로나 항을 중립값으로 기본 설정하는 스크리닝 파이프라인은 증거 부재를 통과 등급으로 변환하고, 기본값이 일관되게 적용되므로 모든 요약 통계에서 보이지 않습니다. 8장이 이를 허용했을 때 순위가 얼마나 심하게 왜곡되는지에 대한 실측을 제시합니다.
RNA는 주로 인산디에스터 골격의 가수분해로 분해되며, DNA에 없는 2'-하이드록실, 수산화이온, 2가 금속이온이 이를 가속합니다. 제형에 결정적인 결과는 화학적이기보다 통계적입니다 — 전사체는 모든 결합이 온전할 때만 온전합니다. 각 결합이 단위시간당 독립적 절단 확률을 가지면, 전장 분자의 분율은 길이와 시간의 곱에 따라 감쇠합니다. 따라서 4,000 뉴클레오티드 mRNA는 동일 조건에서 1,000 뉴클레오티드보다 약 4배 빠르게 완전성을 잃고, 짧은 이중가닥은 같은 시간 규모에서 사실상 면역입니다.
이 한 사실이 모달리티 간 저온유통 요구 차이의 대부분을 설명하며, 플랫폼이 페이로드 길이를 메타데이터가 아니라 안정성 축의 입력으로 다루는 이유입니다. 엔진 자신의 페이로드 길이 관련 결함 이력이 중요한 이유도 이것입니다 — 설계된 분자의 실제 길이가 아니라 카고 클래스의 기본 길이를 읽는 스테이지는 순위화 대상과 다른 분자의 안정성을 계산하게 됩니다. 그 결함은 존재했고 기록되었으며, 이제 페이로드 길이가 설계별로 해소되는 이유입니다.
플랫폼이 채점하는 완화책은 같은 기전에서 따라 나옵니다 — 촉매 금속 제거를 위한 킬레이션, 가수분해 최소점 근처 pH 제어, 반응물이자 이동 매질인 물을 제거하는 동결건조, 그리고 실용적으로 가능한 최저 보관 온도입니다. 유통 경제성을 바꾸는 것은 동결건조이며, 동결건조와 재수화를 견디는 제형이 냉동 유통을 요구하는 제형과 근본적으로 다른 사업 프로파일을 갖기 때문에 독립 축으로 채점됩니다.
지질나노입자 현탁액은 구성상 열역학적으로 불안정하며, 동역학적으로 갇혀 있습니다. 갇힌 상태를 유지하는지는 항상 존재하는 반데르발스 인력과 공학적으로 부여한 정전기·입체 반발 사이의 균형이 지배합니다. 그 결과인 에너지 장벽(열에너지 단위로 표현)이, 확산으로 충돌한 두 입자가 융합할지 분리될지를 결정합니다.
이 장벽을 계산하는 실용적 가치는 하나의 수치가 서로 무관해 보이는 긴 관찰 목록을 예측한다는 점입니다 — 보관 중 입도 분포가 이동하는지, 준가시 미립자 수가 약전 한계를 넘는지, 제품이 동결-해동 사이클을 견디는지, 세침 주사 전단에서 응집하는지, 수송 중 교반이 응집핵을 만드는지. 엔진은 장벽과 함께 임계응집농도 — 반발이 충분히 차폐되어 장벽이 사라지는 이온강도 — 도 계산하며, 이것이 물리를 완충액 규격에 연결합니다.
이것이 보호하는 생물학은 단순하고 용서가 없습니다 — 응집체는 큰 입자가 아니라 잃어버린 용량이자 면역원성 리스크입니다. 응집된 물질은 전달되지 않고 포식세포에 제거되며, 주사제 내 미립자는 약전 부적합이자 주입 반응의 경로입니다.
평형화되지 않은 궤적에서 계산한 분자동역학 관측량은 오차 막대가 큰 추정값이 아니라 초기 조건의 측정값입니다. 따라서 플랫폼은 고정 시간을 돌리고 나온 것을 보고하는 대신 포화를 검정합니다.
검정이 자기상관을 보정하며, 이것이 핵심 세부 사항입니다. 궤적의 연속 프레임은 독립 표본이 아니고, 독립으로 취급하면 표준오차를 상관시간의 제곱근만큼 — 흔히 한 자릿수 — 과소평가합니다. 상관된 데이터에 대한 순진한 정상성 검정은 따라서 이르게 그리고 확신을 갖고 수렴을 선언합니다. 상관시간을 보정한 뒤에야 평평한 평균이 실제로 수렴한 평균을 뜻합니다.
평균은 각 궤적의 후미 분율에 대해 취하고, 독립 시드 간 중심 추정값은 평균이 아니라 중위수입니다. 비물리적 구조에 빠진 한 시드가 보고값을 끌고 가지 못하게 하기 위함입니다. 여기서 다중 시드는 정밀화가 아닙니다 — 단일 시드로는 수렴한 결과와 갇힌 결과를 구별할 수 없으므로, 시드 산포가 선택적 점검이 아니라 측정의 일부입니다.
지속시간은 명시적 티어로 예산화됩니다 — 생산 샘플링 명목 50 나노초, 1.5 마이크로초, 2 마이크로초 — 그래서 스크리닝 질문과 기전 질문을 같은 파이프라인에 매우 다른 비용으로 물을 수 있습니다. 적분 시간간격은 조대화 모델에 0.02 피코초이고, 화학상 필요했던 한 변이체에서 0.005로 축소됩니다. 그 축소는 같은 시뮬레이션 시간의 비용을 4배로 만들므로, 전역 적용이 아니라 변이체별로 기록되어야 하는 종류의 결정입니다.
플랫폼 내 단일 하위 시스템 중 가장 큽니다. 이것의 존재가 본 엔진과 지질 설계 도구 사이의 주된 구조적 차이입니다. 목적은 통상 허가용 안정성이나 공정 밸리데이션 단계에서 드러나는 질문들을 설계 시점에 답하는 것입니다 — 답의 비용이 오후 한나절이 아니라 재제형인 그 시점 이전에.
42개 모듈 전부가 게이트가 아니라 가산적 리스크 렌즈입니다. 어느 것도 후보를 순위 산출물에서 제거할 수 없습니다. 각각이 0-1 정규화 지수, 범주형 등급, 그리고 고유 단위의 원시 물리값 1-2개를 산출하며, 전체 집합이 하나의 상한이 걸린 복합 항으로 접힙니다. 42개 독립 항이 아니라 상한 복합항인 이유는 8장에서 설명합니다.
|
모듈 |
추정 대상 |
약전 근거 |
|
무균 여과 |
직경이 막 등급에 근접하는 입자의 여과 통과와 세균 저지 |
멸균등급 여과 관행 |
|
무균 충전 |
충전 설계가 함의하는 오염률 |
EU GMP Annex 1 |
|
용기 밀폐 |
1차 용기에 대한 적합성·흡착·추출물 |
ICH Q1A 용기밀폐 요구 |
|
밀폐 완전성 |
실링부 누출률 리스크 |
용기밀폐완전성 시험 |
|
준가시 미립자 |
규제 크기 임계 이상 입자 수 |
USP <788> |
|
외관 |
가시 미립자·유백광 리스크 |
가시 미립자 검사 |
|
인출 용량 |
표시 용량을 실제로 인출할 수 있는지 |
인출가능용량 요구 |
|
주사성 |
주어진 니들 게이지로 압출하는 데 필요한 힘 |
주사기 통과성 관행 |
|
사용 중 안정성 |
투여 매체로 희석 후 보관 시간 |
사용 중 안정성 요구 |
|
주입 적합성 |
흡착에 의한 투여 세트 손실 |
투여 세트 적합성 |
준가시 미립자가 안정성 논의의 한 줄이 아니라 전용 축을 갖는 이유: 주사용 나노입자 제품에서는 미립자 규격과 제품 자체가 같은 물질로 되어 있습니다. 어떤 응집 경로든 제품을 규격 부적합으로 변환하고, 약전 임계값이 질량 분율이 아니라 개수이므로 극소량의 응집체 질량이 배치를 탈락시킬 수 있습니다. 5.8절에서 계산한 콜로이드 안정성 장벽이 이 축의 상류 물리 예측자이며, 그래서 둘이 따로 보고되지 않고 배선되어 있습니다.
|
모듈 |
추정 대상 |
약전 근거 |
|
니트로사민 / NDSRI |
공정·보관 조건에서 지질 자신의 2차·3차 아민으로부터의 생성 가능성 |
ICH M7 우려 코호트 |
|
원소 불순물 |
촉매·장비·용기로부터의 이행 |
ICH Q3D |
|
잔류 용매 |
에탄올 기반 나노침전 공정의 부담 |
ICH Q3C |
|
부형제 분해 |
주성분이 아니라 부형제로부터의 분해산물 생성 |
일반 불순물 관행 |
니트로사민 축은 순수 구조 기반 예측이 실제 규제 결과를 갖는 가장 분명한 사례이므로 따로 언급할 값이 있습니다. 이온화성 지질은 설계상 3차 아민을 중심으로 구성됩니다 — 적정되는 기능기가 바로 그것입니다. 3차·2차 아민은 동시에 니트로소화제 존재 하에서 니트로사민 생성의 기질이며, 니트로소화제는 부형제의 아질산염 불순물로 유입될 수 있습니다. 그 결과인 니트로사민 원약물 관련 불순물은 허용 섭취량이 나노그램/일 수준인 우려 코호트에 속하며, 이는 그것을 위해 설계되지 않은 통상 불순물 시험법이 검출조차 못하는 수준입니다. 이 부채를 설계 시점에 구조로부터 식별하는 것이, 다른 아민을 고르는 것과 허가용 배치에서 문제를 발견하는 것의 차이입니다.
|
모듈 |
추정 대상 |
|
동결건조 |
동결건조 사이클 실현성과 동결보호제 요구 |
|
재수화 |
재수화 후 크기·다분산도·캡슐화 회복 |
|
동결건조 보관 |
건조 상태 저장수명 |
|
동결건조 표적화 유지 |
표면 리간드가 건조 사이클을 기능적으로 온전하게 통과하는지 |
|
동결-해동 |
사이클당 누적 손상 |
|
저온 pH 이동 |
완충액 성분이 동결 시 만드는 pH 편위 |
|
지질 결정화 |
냉동 보관 중 지질상 규칙화 |
|
RNA 완전성 |
길이 의존 가수분해 단편화 (5.7절) |
|
pH 드리프트 |
저장수명에 걸친 완충 드리프트 |
|
헤드스페이스 산소 |
불포화 지질의 산화 분해 |
|
광안정성 |
광유도 분해 |
|
강제 분해 |
의도적 스트레스 하 거동 |
|
온도 편위 |
평균동역학온도를 통한 유통 편위 소모 예산 |
|
수송 진동 |
수송 진동이 만드는 응집핵 |
|
교반 |
취급에 의한 계면 스트레스 |
|
전단 |
주사·공정 중 스트레스 |
|
침강 |
저장수명에 걸친 중력 침강 |
|
누출 |
보관 중 입자로부터 페이로드 손실 |
|
벌크 보관 |
충전 전 벌크 제품 보관 시간 |
|
Cap 안정성 |
보관에 걸친 mRNA cap 완전성 |
이 중 둘이 진짜로 반직관적인 실패 양상을 인코딩하며, 이 군이 큰 이유입니다.
동결은 열적 사건이기만 한 것이 아니라 화학적 사건입니다. 완충 용액이 동결될 때 성분들은 함께 유리화되지 않습니다. 용해도가 다른 성분을 가진 완충액은 한 성분이 우선적으로 결정화하고, 남은 미동결 농축액의 pH가 이동합니다 — 흔히 만나는 최악의 경우 산성 방향으로 1 단위 이상. 따라서 실온에서 가수분해 최소점에 편안히 완충된 제형이 냉동 보관 기간을 가수분해가 상당히 빠른 pH에서 보낼 수 있습니다. 페이로드를 보호하려는 동결이 그 분해를 가속할 수 있으며, 제형 pH가 아니라 동결농축액 pH를 모델링하는 축만이 이를 봅니다.
리간드는 구조적으로 건조를 생존하고 기능적으로는 생존하지 못할 수 있습니다. 표면 접합 표적화 리간드가 동결건조 사이클을 화학적으로 부착된 상태로 통과하면서 수용체가 요구하는 입체구조나 표면 제시를 잃을 수 있습니다. 크기·다분산도·캡슐화에 기반한 회복 측정은 깨끗한 재수화를 보고하고 이에 대해 아무 말도 하지 않습니다. 표적화 유지가 재수화에 접히지 않고 따로 채점되는 이유입니다.
|
모듈 |
추정 대상 |
|
접선흐름여과 |
완충액 교환과 농축 성능 |
|
미세유체 스케일업 |
벤치 규모에서 입자를 만든 혼합 영역이 제조 규모에서 재현되는지 |
|
공정능력 |
특성별 능력지수와 함의된 불량률 |
|
배치 동등성 |
특성별 허용대역에 의한 배치 간 유사성 |
|
효력 |
예측 상대 효력 |
|
콜로이드 안정성 |
상호작용 에너지 장벽과 임계응집농도 |
|
품질 롤업 |
계층 전체를 제조성 복합값으로 집계 |
|
서류 |
규제 규격표와 공백 보고서 |
미세유체 스케일업 축은 일상적이고 비싼 실패를 포착합니다. 나노침전에서 입자 크기는 조성만이 아니라 혼합시간 대 응집시간의 비가 결정합니다. 벤치 미세유체 칩에서 잘 거동하는 입자를 주는 조성이 혼합시간이 다른 생산 믹서에서는 다른 입도 분포를 줄 수 있고, 그 변화는 올바르게 제형된 배치에서 규격 외 크기로 나타납니다. 설계 시점에 혼합 영역을 모델링하는 것이 조성을 벤치 성능이 아니라 규모 불변성을 위해 고를 수 있게 합니다.
서류 모듈은 예측·기지 중요품질특성을 규격표 골격으로 집계하며, 특성별 시험법과 허용기준, 그리고 완결도 백분율과 명시적 공백 보고서를 함께 냅니다.
공백 보고서가 중요한 절반입니다. 어떤 특성은 계산으로 전혀 확정할 수 없습니다 — 확인시험, 실제 안정성 데이터셋, 측정된 불순물 프로파일, 무균성, 엔도톡신. 모듈은 이들을 계산 대용값으로 채우지 않고 미해결 공백으로 열거합니다. 조용히 채우는 도구는 완성된 것처럼 보이면서 위험한 문서를 만듭니다 — 심사자가 측정 항목과 추정 항목을 구별할 수 없기 때문입니다. 명시적으로 70% 완결이고 누락 30%가 명명된 표가, 완결을 주장하는 표보다 유용합니다.
v3.0까지 플랫폼의 무게중심은 주어진 후보를 채점하는 데 있었습니다. 본 장이 기술하는 계층은 후보를 생성하며, 플랫폼의 성격을 스크린에서 설계자로 바꾼 것이 이것입니다.
모든 가중 점수에는 상대적 중요도에 대한 판단이 내장되며, 그 판단은 통상 검토되지 않습니다. 캡슐화가 탈출보다 두 배 가중되면, 그 순위는 캡슐화의 주어진 개선이 탈출의 같은 개선보다 두 배 가치 있다고 주장합니다 — 실제로 아무도 확신을 갖고 지지하지 않는 주장입니다.
파레토 탐색은 이 질문을 우회합니다. 목적함수들을 하나의 수치로 접는 대신 비지배 집합을 식별합니다 — 다른 어떤 설계도 모든 목적에서 같거나 낫고 하나에서 엄격히 낫지 않은 모든 설계. 결과는 승자가 아니라 프론트이며, 프론트에는 달성 가능한 절충 공간이 실제로 얼마나 탐색되었는지를 정량화하는 초부피 커버리지 지표가 함께 붙습니다 — 진짜로 얇은 프론트와 표본이 부족한 탐색을 구별해 줍니다.
실용적 가치는 프론트가 절충의 형태를 드러낸다는 점입니다. 프론트가 급격히 휘어 있으면 한 축의 작은 양보가 다른 축의 큰 이득을 사며, 이는 확정 전에 알 값이 있습니다. 거의 평평하면 축들이 실제로 긴장 관계에 없고 가중치 논쟁은 무의미했습니다.
지질을 최적화하고, 그다음 조성을, 그다음 구조를 순차적으로 최적화하면 처음 고른 지질에 대한 최적 조성을 찾습니다. 조성이 조립 입자의 겉보기 pKa를 바꾸고 겉보기 pKa가 지질을 선정한 기준이므로, 이 순차는 순환적이며 결과가 어디서 진입했는지에 의존합니다.
결합 최적화기는 화학과 구조를 함께 탐색합니다. 현행 릴리스에서 이 스테이지가 활성 모델을 덮도록 캐시 키가 확장된 스테이지이며, 따라서 수치가 움직이는 스테이지입니다 — 체크포인트 184건 재실행. 이를 명시하는 것이 핵심입니다 — 결과를 바꾸는 수정은, 그 전에는 아무것도 하지 않고 있던 수정입니다.
두 생성기가 구조를 선택하지 않고 산출합니다. 이온화성 지질 생성기는 목표 겉보기 pKa를 조건으로 프래그먼트를 조립하며, 하류 생물학이 실제로 읽는 파라미터가 그것이므로 올바른 조건 변수입니다. 리간드 생성기는 카탈로그가 다루지 않는 수용체에 대한 표적화 헤드를 제안합니다.
정직한 정리: 생성된 구조는 합성 비용이 붙은 가설이며, 그래서 플랫폼이 예측 성능과 함께 합성 가능성을 채점합니다. 훌륭한 점수로 만들 수 없는 분자를 제안하는 생성기는 아무것도 산출하지 않은 것입니다.
조성 탐색은 지질 몰비 심플렉스를 다섯 번째 장기표적화 지질의 선택·비율과 PEG 분자량과 결합해 탐색합니다. 기전은 2.2절에서 다뤘습니다 — 전하 부호가 코로나 조성을 통해 트로피즘을 재지향합니다 — 그리고 탐색이 그 기전을 정량적 설계공간으로 바꿉니다.
이 계층을 구조 예측에 의존하기 전에 읽어야 하는 구체적 한계가 하나 있습니다. 엔진은 다섯 번째 지질 후보 15종을 등록하는데, 15종 중 9종에 전용 조대화 파라미터 파일이 없습니다. 그 9종은 채점 스테이지에서는 완전히 사용 가능하지만 시뮬레이션 입자로 구축될 수 없습니다. 따라서 그중 하나를 선택하는 설계는 화학으로 채점되고 구조적 교차검증 없이 남으며, 유사 지질로 대체하지 않고 출력이 그 사실을 기록합니다.
측정과 만나지 않는 예측은 개선되지 않습니다. 피드백 모듈은 습식 실험 결과를 수용하고 설계공간에 대한 사후분포를 갱신하며, 기대 성능과 기대 정보 획득을 균형하는 획득함수로 차기 배치를 제안합니다 — 배치가 예측 점수 최대화만이 아니라 부분적으로 불확실성 해소를 위해 선택되도록.
현재 상태를 명시합니다 — 본 문서 시점에 플랫폼 예측을 검증하는 대규모 전향적 습식 실험 코호트는 없습니다 [검증 필요]. 피드백 기구는 구현·테스트되어 있고, 그것이 소비할 코퍼스는 아직 크지 않습니다. 따라서 10장의 모든 성능 진술은 전향적 눈가림 비교가 아니라 내부 계산 검증, 문헌 방향성 일치, 단위테스트 통과에 근거합니다.
순위 스테이지는 변이체당 60개 이상의 체크포인트를 읽어 382개 키를 지닌 하나의 행으로 평탄화합니다. 그 행이 비교 단위이고, 감사 기록이며, 고객이 받는 것입니다.
기능이 아니라 실재하는 취약성이므로 공개할 속성이 하나 있습니다 — 출력 표의 헤더가 첫 번째 행의 키에서 취해집니다. 첫 변이체가 어떤 축을 갖지 않으면 그 열은 모두에게 없습니다. 엔진 자체 문서가 이를 표시합니다. 여기 적는 이유는, 변이체 순서가 다른 두 실행을 비교하는 고객이 열이 나타나거나 사라지는 것을 보고 계산이 실패했다고 합리적으로 결론 내릴 수 있기 때문입니다.
복합값은 게이트가 걸리고 가중치가 재정규화된 평균입니다:
p = gate * SUM(w_i * v_i) / SUM(w_i) 존재하는(PRESENT) 모든 축 i에 대해
각 기여값은 0-1로 정규화되며, 그리고 이것이 하중을 받는 조항입니다 — 부재 축은 0이나 기본값으로 채점되지 않고 두 합에서 모두 제외됩니다. 평균은 실제로 측정된 것에 대해 재정규화됩니다.
가중치는 외부 파일에서 캘리브레이션 가능하며 수작업 기본값으로 폴백합니다. 가장 무거운 것은 캡슐화 효율 0.20, 예측 형질도입 효율 0.14, 그다음 형태·변형 품질·FTO·제조성 복합값으로 이루어진 0.12 군입니다. 친화도, 치료지수, pKa 창 적합도, 효력이 각각 0.10입니다. 약 40개 추가 축이 0.02-0.09를 갖습니다.
순위 해상도에 큰 영향을 주는 미묘한 산술 논점이며, 처음에는 품질의 과소 가중처럼 보이므로 명시할 값이 있습니다.
품질 축 42개는 구성상 거의 포화되어 있습니다 — 잘 설계된 제형은 대부분에서 높은 점수를 받으므로 값들이 범위 상단에 몰립니다. 재정규화 평균에서 42개 독립 항으로 실으면 분모를 지배해 모든 후보의 복합값을 같은 높은 값으로 끌어당기며 — 순위가 드러내려 존재하는 바로 그 차이를 압축합니다. 탈출 자유에너지에서 실질적으로 다른 두 후보가, 거의 동일한 품질 항 42개에 묻혀 거의 같아 보이게 됩니다.
따라서 품질 계층은 따로 누적되어 하나의 상한 복합 항으로 접힙니다. 효과는 품질이 여전히 주의를 게이트하고 모든 행에 전체 상세로 나타나면서, 순위의 판별력은 실제로 후보 간에 변하는 축을 위해 보존되는 것입니다. 42개 축은 중요도에서 하향 가중된 것이 아니라, 같은 명제에 42표를 던지는 것을 방지된 것입니다.
관련 보정이 개별 축 내부에도 나타납니다. 친화도와 치료지수는 선형 형태가 포화되었기 때문에 둘 다 로그 형태로 재스케일되었습니다 — 1 나노몰에서 0.1 나노몰로의 변화는 생물학적으로 막대하고 0에서 하한이 걸린 선형 축에서는 거의 보이지 않습니다.
평균은 보상을 보상합니다. 아홉 축에서 뛰어나고 열 번째에서 실격인 입자가, 열 번째 축 하나만으로 제조 불가 또는 투여 불가가 결정되는데도 균일하게 좋은 입자를 앞섭니다. 전달은 직렬 과정이고, 직렬 과정은 최악의 단계가 지배합니다.
따라서 플랫폼은 평균이 아니라 최악 범주에서 유도한 연속 곱셈 벌점을 적용합니다 — 행을 다섯 실패 범주(전달, 안정성, 안전, 효력, 지식재산·제조)로 접고, 최약 범주의 점수를 임계값 0.5에 대해 평방근 지수로 완화한 값이 복합값에 곱해집니다. 완화는 의도적입니다 — 급격한 절벽은 임계값 근처의 작은 변화에 순위를 불안정하게 만듭니다.
그 위에 선택적 엄격 계층이 존재하며, 3상태 설계가 주목할 부분입니다. 최약 범주가 한계 미만이면 후보의 게이트 확률을 0으로 내릴 수 있지만, 기본값은 None이고 이는 거부권 계층이 아예 적용되지 않았다는 뜻으로 "적용되었고 통과했다"와 구별되는 상태입니다. "거부권 미설정"과 "거부권 통과"를 뒤섞는 것이 바로 3상태 규약이 방지하려는 오류입니다.
본 문서에서 가장 교훈적인 수치이며, 이 플랫폼을 넘어 잘 일반화됩니다.
부재 축이 제외되고 평균이 재정규화되므로, 측정된 축이 적은 변이체는 자기가 가진 것만으로 채점됩니다 — 그리고 고비용 물리 스테이지를 한 번도 돌리지 않은 변이체는 그 축에서 나쁜 점수를 받을 기회 자체가 없습니다. 결과가 직접 측정되었습니다 — 중위 복합확률이 분자동역학 증거가 없는 변이체 68건에서 0.7882, 증거가 있는 56건에서 0.6401이었고, 상위 8개 행 전부가 분자동역학 없는 행이었습니다. 파이프라인이 계통적으로 무지를 보상하고 있었습니다.
결정적 통찰은 어떤 가중치 선택으로도 이것이 고쳐지지 않는다는 점입니다. 가중치는 값에 곱해집니다. 합에서 부재한 값에 벌점을 줄 수는 없습니다. 물리 축을 하향 가중하면 문제가 악화되고, 상향 가중해도 그 축이 없는 행에는 아무 변화가 없습니다.
따라서 해결책은 계수가 아니라 사전식(lexicographic) 정렬입니다 — 습식 실험 인계 목록은 먼저 분자동역학 증거 존재 여부로, 그다음에만 복합확률로 정렬합니다. 증거가 충실한 0.64 후보가 증거 없는 0.79 후보보다 위에 놓이는데, 둘 사이의 비교가 복합값만으로는 의미가 없기 때문입니다. 전체 순위표는 둘 다 유지하며 증거 등급을 명시 열로 갖습니다.
일반 원칙: 존재 축에 대한 재정규화는 같은 것끼리 비교할 때 옳고, 존재 축 집합이 후보마다 다른 순간 편향이 됩니다. 선택적 고비용 스테이지를 가진 모든 파이프라인은, 증거 깊이를 점수와 분리하지 않는 한 이 편향을 갖습니다.
모든 복합값이 베타 사후분포에서 유도한 신용구간과 함께 보고되므로, 증거가 얇을 때 구간이 장식적으로 일정하지 않고 실제로 넓어집니다. 점추정값이 아니라 하한으로 순위화할 수 있으며, 이것이 보수적 선택입니다 — 확실히 좋은 후보를 아마도 훌륭한 후보보다 선호합니다.
고객이 후보 5개를 합성할 수 있을 때, 점수 상위 5개를 취하는 것은 통상 잘못된 선택입니다. 상위 5개가 흔히 화학 스캐폴드를 공유하고 따라서 실패 양상을 공유하기 때문입니다. 그 양상이 실재하면 다섯이 함께 실패하고 실험은 1비트의 정보를 반환합니다.
플랫폼은 구성원의 최약 범주가 서로 다른 패널을 선정해 배치가 여러 독립 가설을 검정하게 합니다. 2.2절의 화학적 중복 묶음이 여기에 직접 공급됩니다 — 구조적으로 동일한 두 변이체는 점수가 어떻든 패널 다양성을 가질 수 없습니다.
다섯 조건이 행을 습식 실험 인계 목록에서 제거합니다 — FTO 차단 판정, 물리화학 탈락, 낡은 상류 증거, 자리표시 표적, 설계와 채점 구조 간 화학적 불일치.
그 다섯 경우 모두에서 행은 플래그가 붙은 상태로 전체 순위표에 남습니다. 후보를 합성 목록에서 제외하는 것과 기록에서 삭제하는 것은 다른 행위이고, 둘을 뒤섞으면 심사자가 무엇이 왜 빠졌는지 물을 능력이 파괴됩니다. 다섯 중 둘은 명시적 플래그로 재정의할 수 있으며 이는 적절합니다 — 낡은 상류 증거는 왜 낡았는지 아는 사용자에게는 수용 가능할 수 있습니다.
1분 만에 끝나는 스크리닝 계산은 작동하거나 눈에 보이게 실패합니다. 수십 변이체에 걸친 다일 물리 캠페인은 세 번째 방식으로 실패합니다 — 작동하는 것처럼 보이고, 산출물을 내고, 그 산출물이 말하는 바를 뜻하지 않습니다. 본 장의 모듈들은 각 양상이 설계 시 예상된 것이 아니라 운영 중 관측되었기 때문에 존재합니다.
|
신뢰했던 대용 신호 |
거짓말한 이유 |
대체한 것 |
|
도구 디렉토리가 있으므로 도구가 작동한다 |
해당 스테이지가 null 예측을 쓰는 기간 전체에 디렉토리는 존재했다 |
디렉토리 그리고 모델 가중치 파일 그리고 도구가 필요한 모든 파이썬 임포트를 검사 |
|
파일이 있으므로 스테이지가 돌았다 |
부분 기록되거나 스텁인 체크포인트도 존재한다 |
ok와 skipped만 화이트리스트, 그 외 전부 재실행 |
|
체크포인트가 ok라고 하므로 최신이다 |
폐기된 코드가 쓴 것이었다 |
래퍼 해시·레지스트리 행·서열 해시·참조 데이터 버전을 덮는 내용 지문 |
|
상태 필드가 없었으므로 문제 없었다 |
부재가 성공과 구별되지 않았다 |
3상태 반환: 값, None + 상태 문자열, 또는 에러. None은 결코 통과로 세지 않음 |
|
디렉토리 수정시각이 활동을 보여준다 |
재개된 트리는 디렉토리 타임스탬프를 움직이지 않는다 |
타임스탬프가 아니라 산출된 결과물로 활동을 판정 |
|
딕셔너리에 키가 있으므로 그 값은 측정되었다 |
존재하는 키가 기본값을 담을 수 있다 |
값과 함께 명시적 scored / unscored 상태 |
표 9-1. 대용 신호 대 실제 검증. 각 행이 운영 중 관측되어 이후 인코딩된 실패 양상입니다 [내부 실측].
첫 행은 표에서 가장 값싼 교훈이므로 확장할 값이 있습니다. 어떤 머신러닝 예측기가 자기 디렉토리 존재 여부로 게이트되어 있었습니다. 디렉토리는 존재했고, 모델 가중치와 필요한 파이썬 패키지 두 개는 없었습니다. 상태 표시는 대응 스테이지가 모든 행에 null 예측을 쓰는 기간 전체에 도구를 사용 가능으로 보고했습니다. 아무것도 에러를 내지 않았고, 그 행들에 대한 요약 통계는 null에 대해 계산되었을 것입니다. 이제 검사는 디렉토리, 가중치 파일, 각 임포트를 모두 요구하고 하나라도 없으면 도구를 사용 불가로 보고합니다.
플랫폼의 결함 이력 전체에서 가장 반복된 교훈은, 누락값에는 통과값과 실패값 모두와 구별되는 자기 표현이 필요하다는 것입니다. 엔진은 이제 여러 곳에서 같은 형태로 이를 구현합니다 — 값·레코드·상태의 3항조이며, 값은 None일 수 있고 상태가 이유를 말합니다.
채점 보조 함수 5개가 이 규약을 쓰고, 코로나 모듈은 명시적 scored/unscored 리터럴로 씁니다. 결과는 기본값 대입이 아니라 제외·재정규화하는 순위 산술로, 그리고 빈 셀이 아니라 명시적 부재 행을 렌더링하는 보고 계층으로 흘러갑니다.
뇌 표적화 축이 이 규약이 실제로 작동하는 모습을 보여 줍니다. 뇌 표적 변이체 8건 중 4건이 혈액뇌장벽 축에서 미채점이며, 코드가 규칙을 명시합니다 — 미채점은 게이트하지 않는다. 그 4건은 탈락도 통과도 아니고, 축이 재정규화로 제외되고 상태가 보이는 상태로 유지됩니다. 2상태 게이트라면 그들을 탈락시켜 정당한 후보 4건을 버리거나, 통과시켜 한 번도 하지 않은 장벽 평가를 조용히 주장해야 했을 것입니다.
긴 시뮬레이션은 청크로 실행되어 중단 비용이 캠페인이 아니라 한 청크가 되게 하며, 재개는 존재가 아니라 내용으로 결정됩니다. 재시작은 실제로 산출된 것을 다시 읽고 거기서 이어갑니다.
고비용 스테이지가 낡음(staleness) 로직에서 받는 특별 취급은 실수가 아니라 명시적 절충이므로 설명할 값이 있습니다. 상류 증거가 바뀌면 저렴한 스테이지는 그냥 재계산됩니다. 고비용 스테이지 — 구축, 생산 동역학, 궤적 분석, 자유에너지 구간, 코로나, 역매핑, 막 자유에너지 — 는 재계산도 삭제도 하지 않습니다. 낡음 플래그, 낡음 근거, 낡음 이유를 붙인 상태로 결과가 반환됩니다. 대안은 상류 편집 시 며칠의 계산을 자동으로 폐기하는 것이고, 그 판단은 사람이 해야 한다는 것이 이 설계의 입장입니다. 그 판단을 내리기 위한 명시적 플래그가 둘 있습니다 — 하나는 재계산을 강제하고, 다른 하나는 낡은 결과를 수용해 플래그를 유지한 채 행을 통과시킵니다.
3.6절의 구조적 불변식이 중요한 이유도 이것입니다. 지문 무효화 경로에 고비용 스테이지 가드가 없으므로, 어떤 고비용 스테이지도 지문을 갖지 않는 동안만 안전하며, 그것이 참이 아니게 되면 프로그램이 기동을 거부합니다.
물리 계층은 다른 파이프라인과 공유하는 가속기에서 돌며, 이는 단일 테넌트 시험에서 보이지 않는 실패 양상을 만듭니다. 엔진은 기본적으로 가속기의 다중프로세스 스케줄러를 우회하고, 설정이 실제로 효력을 갖도록 어떤 수치 라이브러리 임포트보다 먼저 우회값을 설정하며, 워커별로 코어를 고정하고, 실패한 기동을 백오프와 함께 제한된 횟수 재시도한 뒤 느린 프로세서 전용 경로로 폴백합니다.
우회를 기본값으로 둔 것은 선호가 아니라 조사의 결론이며, 정직한 요약은 혼재입니다 — 스케줄러를 경유하면 한 종류의 하드웨어 오류는 제거되었으나 동시 부하 하의 크래시는 제거되지 않았으므로 우회가 유지되고 근본 원인은 미해결입니다. 캠페인을 진행시키는 것은 두 구성 모두에서 정족수까지 재시도하는 루프입니다. 해결된 문제라고 주장하는 것보다 이것을 명시하는 것이 유용합니다 — 공유 하드웨어에서 기전 티어를 돌리는 고객은 간헐적 재시도를 보게 되고, 그것이 예상되고 흡수되는 것임을 알아야 합니다.
결정성은 임포트 시점에 고정되는 해시 시드, 시드가 고정된 확률적 단계, 정렬되고 안정적으로 직렬화된 체크포인트로 확보됩니다. 이것의 가치는 좁고 실재합니다 — 재실행이 수치를 정확히 재현하므로, 두 실행 간 불일치는 표본 잡음이 아니라 코드 또는 입력 변경의 증거입니다. 이 속성이 지문 시스템을 의미 있게 만듭니다 — 결정성이 없으면 변한 수치를 결코 귀속시킬 수 없습니다.
플랫폼은 정직하고 의도적으로, 확립된 실험적 표준을 대체하는 것이 아니라 그 상류에 위치하고 그것으로 확증되는 in-silico 트리아지·설계 계층으로 자리매김합니다. 임무는 희소한 습식 실험 역량을 어디에 쓸지 결정하는 것이며, 그래서 뒤따르는 분석이 그것을 통과할 가능성이 가장 높은 분자에 대해 수행되게 하는 것입니다.
|
역량 |
실험적 표준 |
플랫폼 접근 |
자리매김 |
|
지질 → 직경·다분산도 |
미세유체 제조 후 동적광산란 |
GC-LIPIDSCORE 앙상블 + GC-MDCORE 구조 교차검증 |
공개 예측기와 대등, 추가로 기전 검증 |
|
겉보기 pKa |
염료 적정 측정 |
GC-PKA 자기일관 표면전위 해법 |
in-silico 스크린. 적정으로 확증 |
|
캡슐화 효율 |
형광 결합 분석 |
GC-TRAJ 기하학적 캡슐화 + 형태 판정 |
합성 전 예측 |
|
엔도솜 탈출 |
시험관 내 리포터 분석 |
GC-PMF 자유에너지 장벽 + GC-ESCAPE 지수 |
기전적 순위화 |
|
장기 트로피즘 |
생발광 영상 또는 바코드 시퀀싱 |
GC-TROPISM 조성 그래프 + 종간 전환 |
설계 단계 우선순위화. 측정 필수 |
|
안정성·저장수명 |
ICH 실시간·가속 시험 |
가수분해·금속 촉매·pH 드리프트 항을 포함한 아레니우스 동역학 |
예측 저장수명 |
|
준가시 미립자 |
광차폐 계수 |
약전 임계 구동인자 롤업 |
시험 전 리스크 트리아지 |
|
무균 보증 |
미디어 필 |
Annex 1 오염률 모델 |
설계 단계 리스크 |
|
용량 전환 |
알로메트릭 스케일링 |
종간 약동학 + 체표면적 스케일링 |
표준 정합 |
|
배치 동등성 |
측정 배치 + 동등성 검정 |
특성별 허용대역 유사도 지수 |
설계 단계 대용. 측정 대체 불가 |
|
니트로사민 리스크 |
표적 질량분석 측정 |
구조 기반 생성 가능성 모델 |
설계 시점 회피용. 정량용 아님 |
표 10-1. 역량별 자리매김. 어느 행도 계산이 측정을 대체한다고 주장하지 않습니다.
모든 모듈이 측정 결과가 아니라 휴리스틱으로 명시 표시되며, 그 표시는 각주에 묻히지 않고 출력에서 강제됩니다. 아래 목록은 v3.0보다 깁니다. 의도적입니다 — 증가는 새로운 약점이 아니라 더 나은 감사를 반영하며, 명명된 한계는 고객이 대비할 수 있는 한계입니다.
검증 상태
· 전향적 습식 실험 코호트 없음. 본 문서 시점에 플랫폼 예측을 검증하는 대규모 전향적 눈가림 데이터셋이 없습니다 [검증 필요]. 모든 성능 진술이 내부 계산 검증, 문헌 방향성 일치, 단위테스트 통과에 근거합니다.
· 트로피즘은 설치류 학습. 조성 그래프 트로피즘 모델은 주로 설치류 생체 내 관찰로 구축되었고, 영장류·인간 값은 재학습된 인간 모델이 아니라 경로 의존 문헌 계수에 의한 전환입니다 [문헌 기준].
· 자유에너지는 상대값. 수용체 결합 자유에너지에 표준상태 보정이 없습니다. 변이체 간 비교에 유효하며 절대 해리상수로 인용해서는 안 됩니다.
커버리지로 오인될 수 있는 커버리지 공백
· 13종 모달리티 중 11종이 잠복. 발견 변이체 레지스트리 170건 전부가 siRNA 카고입니다. 나머지 모달리티는 구현·단위테스트되고 도달 가능하나 실제 레지스트리 항목에서 구동되지 않았습니다.
· 장기표적화 지질 15종 중 9종에 조대화 파라미터 없음. 스테이지 0-2에서 채점 가능하고 시뮬레이션 입자로 구축 불가이므로, 그중 하나를 선택하는 설계는 구조적 교차검증을 받지 못합니다.
· 스테롤 계층은 외부 카탈로그이고 미지정 시 조용히 기본값. 스테롤 이름 없이 비율만 주는 제형 레코드는 콜레스테롤로 기본 설정되며 기본 설정 사실이 기록됩니다. 실측된 한 캠페인에서 변이체 60건 전부가 정확히 그 상태였고, 따라서 스테롤 채점이 60/60 건너뛰어졌습니다. 기본 설정은 이제 변이체별로 기록되며, 이것이 스테롤 이름을 생략해도 된다는 뜻은 아닙니다.
· PEG-지질은 카탈로그가 아니라 1종. PEG-지질 정체성 하나가 하드코딩되어 있습니다. PEG 분자량과 밀도는 탐색 가능하고 PEG-지질 화학은 그렇지 않습니다.
· 발견 레지스트리의 3분의 1에 전달체 클래스가 없음. 170건 중 56건에 전달체 클래스가 배정되지 않아 클래스별 처리가 아니라 기본 처리로 라우팅됩니다.
보고·인터페이스 취약성
· 엔진 자신의 버전 배너가 틀렸습니다. 프로그램에 버전 상수가 없습니다. 명령행 설명과 런타임 로그 배너 모두 수백 개정 이전의 릴리스 번호를 표시합니다. 버전 정체성은 파일명과 변경 이력만이 담고 있습니다. 배너를 읽어 무엇이 돌았는지 식별하려는 사용자는 오인하게 되며, 파일명과 실행 매니페스트가 권위 있는 출처입니다.
· 표 열이 첫 행에서 결정됩니다. 출력 표 헤더가 먼저 산출된 변이체의 키 집합이므로, 그 변이체에 없는 축은 전체에 대해 열이 없습니다.
· 자유에너지 계층의 명명 부채. 함수명이 호출되지 않는 표준 히스토그램 재가중 유틸리티의 용어를 유지합니다. 적분은 직접 구현 우산 적분입니다. 거동은 5.4절대로이며 이름이 오해를 유발합니다.
· 엔진은 그림을 산출하지 않습니다. 모든 출력이 표 또는 텍스트입니다. 고객 대면 자료의 도표는 별도로 생성됩니다.
운영
· 채점 축 하나가 코드로 강제되지 않는 상업 라이선스 의무를 지닙니다. 표적화 헤드 결합 포즈의 역장 교차검증이 CNS 엔진을 경유하며, CNS는 비영리 사용에만 무료이고 상업적 배포에는 벤더 라이선스가 필요합니다. 소스가 사용 지점에 의무를 기록하면서 의도적으로 게이트하지 않으므로, 상업적 실행은 그와 무관하게 수치를 산출합니다. 전체 지위와 해소 방법 두 가지는 부록 A.4에 있습니다.
· 동시 가속기 부하에서의 크래시가 미해결입니다. 여러 시뮬레이션이 가속기 하나를 공유할 때 물리 계층이 간헐적으로 크래시합니다. 정족수 재시도 루프가 이를 흡수해 캠페인이 완료되지만 근본 원인이 해소되지 않았으므로, 기전 티어는 이를 감안해 예산화해야 합니다.
종합적 의미. 플랫폼의 진짜 가치는 '실험실 대체'보다 좁고 더 지속적입니다 — 재현 가능하고 감사 가능한 실험 전 리스크 트리아지와 후보 순위화로, 유한한 습식 실험 노력을 가장 유망하고 가장 제조 가능한 입자에 집중시키고, 제조 지뢰를 설계로 우회할 수 있을 만큼 이르게 표시하는 것입니다. 규제 환경에서 과대주장하는 도구는 무용한 것보다 나쁩니다 — 어떤 측정도 지지하지 않는 수치를 심사자가 신뢰하도록 유도하기 때문입니다.
지질나노입자는 최초 승인 siRNA 의약품, 전 지구적 규모로 투여된 mRNA 백신, 그리고 성장하는 mRNA 치료제·생체 내 편집 페이로드·조직 표적 RNA 파이프라인을 가능하게 한 전달 기술입니다. 이 모두를 가로질러 프로그램이 실제로 실패하는 지점에 대한 일관되고 반직관적인 교훈이 나타났습니다 — 흔히 가장 쉽게 맞출 수 있는 부분인 코딩 산물의 생물학이 아니라 전달체입니다.
|
단계 |
가속이 일어나는 곳 |
모듈 |
|
발굴·리드 최적화 |
지질과 조성 후보 수천 건을 예측 직경·겉보기 pKa·캡슐화·탈출 자유에너지·조직 트로피즘으로, 지질 하나도 합성하기 전에 전부 in-silico로 순위화합니다. 합성과 시험관 스크리닝이 초기 발굴의 속도결정 비용이므로, 최초 트리아지를 벤치 상류로 옮기면 모든 축에서 동시에 좋은 점수를 받는 소수 분율에만 화학을 투입할 수 있습니다. |
GC-LIPIDSCORE, GC-LIPIDGEN, GC-PKA, GC-COMPOSE, GC-PMF, GC-TROPISM |
|
제형·CMC |
제조성 부채 — 니트로사민 생성, 원소 이행, 잔류 용매, 준가시 미립자 — 를 사전 스크리닝하고, 동결건조 사이클에서 여과, 미세유체 스케일업까지 공정을 설계하면서 저장수명과 저온유통 요구를 예측합니다. 통상 허가용 안정성이나 공정 밸리데이션에서야 드러나는 작업을 앞으로 당깁니다. |
GC-CMC (42개 모듈), GC-QBD |
|
규제 |
중요품질특성을 포괄하는 규격표 골격과 명시적 커버리지·공백 보고서를 산출하므로, 화학 섹션이 1일차부터 채워지고 측정 확증이 아직 필요한 특성이 명명됩니다. |
GC-DOSSIER |
|
백신 특화 |
내성 가능한 단회 예방 백신과 만성 투여 치료제를 가르는 부채를 정량화합니다 — 선천 감지에 의한 반응원성, 항약물항체 형성, 그리고 1차 투여가 유발한 항-PEG 항체가 후속 투여를 순환에서 제거하는 가속 청소. |
GC-QSARGATE, GC-CMC 선천면역·항-PEG 축, GC-BRIDGE |
이 구분이 다른 어떤 것보다 많은 설계 결정을 지배하고 흔히 '내성(tolerability)'이라는 단일 개념으로 접히므로 분리할 값이 있습니다.
예방 백신은 통제된 양의 선천 자극을 원합니다. 입자와 페이로드에 대한 선천 반응이 기전의 일부입니다 — 적응 반응을 만드는 항원제시세포를 모집하고 활성화합니다. 백신 입자는 1-2회 투여되므로 느린 부채 — 지질 축적, 항-PEG 항체가, 만성 간 노출 — 가 문제가 될 기회가 제한됩니다. 구속 조건은 급성 반응원성입니다.
만성 투여 치료제는 모든 항목에서 반대를 원합니다. 선천 자극은 이득 없는 순수 독성입니다. 느린 부채가 지배적이 됩니다. 단회 투여 연구에서 보이지 않으므로 특별히 언급할 가치가 있는 둘:
*가속 혈중 청소.* PEG는 면역원성입니다. 1차 투여가 항-PEG 항체를 유발할 수 있고, 그 항체가 2차 투여의 PEG 층에 결합해 옵소닌화하고 수 분 내 순환에서 제거합니다 — 2차 투여가 실패하는 이유가 입자가 잘못되어서가 아니라 면역계가 1차 투여를 학습했기 때문입니다. 단회 투여 실험으로는 이를 볼 수 없고, 그래서 플랫폼이 독립 축으로 채점합니다.
*이온화성 지질 축적.* 지질은 전달할 만큼 오래 잔류하고 만성 스케줄에 걸쳐 축적되지 않을 만큼 빠르게 청소되어야 합니다. 분해성 에스터 결합이 표준 해법이며, 이는 원약물 제품 자체의 가수분해 안정성과 직접 상충합니다 — 생체 내에서 청소되는 그 결합이 바이알 안에서 가수분해됩니다.
편집 페이로드는 또 다릅니다. 리보핵단백 또는 뉴클레아제 코딩 페이로드는 외래 단백질이며, 강한 양이온성 지질이 그것에 대해 면역증강제로 작용해 — 치료가 의존하는 바로 그 페이로드에 대한 항약물항체 형성을 증폭합니다. 편집이 통상 단회 투여이므로 항약물항체 반응이 수용 가능할 수 있습니다. 재투여를 고려한다면 수용 불가입니다. 플랫폼은 이 결합을 유보 문구가 아니라 브리지 모듈을 통해 정량적으로 계산합니다.
|
모달리티 |
핵심 설계 결정 |
플랫폼이 답하는 질문 |
|
siRNA / ASO |
변형 패턴과 전달체 클래스의 결합 선택 |
캡슐화 입자가 필요한가, 나출 접합체로 충분한가? |
|
ssRNAi |
RISC 탑재 능력 대비 앵커 길이 |
이 변형 패턴으로 단일가닥이 스스로 탑재될 수 있는가? |
|
mRNA 백신 |
반응원성 대 면역원성, 저온유통 요구 |
동결건조로 초저온 유통 요구를 제거할 수 있는가? |
|
mRNA 치료제(반복투여) |
항-PEG 가속 청소와 지질 축적 회피 |
이 제형이 만성 투여를 생존하는가? |
|
saRNA / circRNA / csaRNA |
매우 큰 카고의 캡슐화, 입자 형태 |
이 크기의 전사체가 온전한 입자를 형성하는가? |
|
생체 내 편집 |
페이로드와 지질의 면역증강 상호작용 |
지질이 항약물항체 리스크를 증폭하는가? |
|
간외 표적 |
다섯 번째 지질 대 리간드 접합 |
조성만으로 목표 장기에 도달할 수 있는가? |
|
중추신경계 |
장벽 셔틀 리간드 대 직접 경로 |
전신 투여인가, 척수강내인가? |
셋은 명명할 값이 있습니다. 각각에서 플랫폼의 산출물이 참고 수준이 아니라 의사결정 수준이기 때문입니다.
구조로부터 발견된 니트로사민 부채. 이온화성 지질의 아민 구조가 생성 가능성을 지니면, 올바른 대응은 아민을 바꾸는 것이고 이는 오후 한나절이 드는 설계 단계 결정입니다. 같은 발견이 허가용 안정성 배치에서 나오면 재제형과 1년이 듭니다.
인출 용량 또는 주사성 실패. 이것들은 최종 제품의 기하학적·유변학적 사실입니다. 표시 용량으로 인출할 수 없거나 의도한 니들로 압출할 수 없는 제형은 생물학적 우수성과 무관하게 실패하며, 어느 쪽도 생물학적 불확실성에 의존하지 않으므로 설계 단계 예측이 확정에 가깝습니다.
전달체 클래스 재배정. 짧은 이중가닥에 대해 플랫폼이 캡슐화 입자보다 접합체가 더 나은 전달체라고 결론 낼 수 있습니다. 이는 순위 조정이 아닙니다 — 이온화성 지질 독성 예산, 캡슐화 규격, 저온유통 문제의 상당 부분을 프로그램에서 아예 제거합니다.
플랫폼의 가치를 얻기 위해 슈퍼컴퓨터, 클러스터 할당, 상주 분자동역학 전문가가 필요하지 않습니다. 대부분의 사용자가 일상적으로 의존하는 두 계층 — 품질 리스크 계층과 성공확률 순위 — 은 일반 프로세서에서 순수 로직으로 빠르게 돌며, 가속기도 네트워크 접근도 필요하지 않습니다. 중량 물리 스테이지는 전적으로 선택이며 기전적·물리 기반 구조 예측을 특별히 원할 때만 개입합니다.
|
티어 |
커버리지 |
하드웨어 |
변이체당 소요 [내부 실측] |
|
1. 설계 + 품질 |
스테이지 0-2, 8, 9와 하프스테이지 품질 계층 전체 |
일반 프로세서, 네트워크 불필요 |
분 단위 |
|
2. 신속 검증 |
위 + 축약 동역학(최소화와 초기 평형화) |
공유 가속기 1개 |
약 30-75분 |
|
3. 완전 기전 |
위 + 완전 생산 동역학과 자유에너지 배터리 |
전용 가속기 1개 권장 |
카고 크기에 따라 시간-일 단위 |
표 12-1. 실행 티어. 티어 1 단독으로 순위표와 규격표를 포함한 모든 주요 산출물이 생성되며, 동역학 유도 축은 미판정으로 표시되고 가중치가 재정규화로 제외됩니다.
티어 선택에 관한 두 가지는 비용이 아니라 8.5절에서 따라 나옵니다.
티어 1은 열등한 답이 아니라 완전한 답입니다 — 단, 모든 후보를 티어 1로 돌리는 경우에 한합니다. 존재 축 집합이 후보 간에 동일할 때 재정규화는 타당합니다.
하나의 비교 안에서 티어를 섞지 마십시오. 일부 후보를 티어 3으로, 일부를 티어 1로 돌린 뒤 함께 순위화하면 증거 등급이 방지하려 존재하는 바로 그 편향이 재도입됩니다 — 티어 1 후보들이 나쁜 점수를 받을 물리 축이 없으므로 평균적으로 더 높은 점수를 받습니다. 예산이 집합의 일부에만 기전 티어를 허용한다면, 혼합 순위를 만드는 데 쓰지 말고 티어 1 순위를 확증하는 데 쓰십시오.
|
단계 |
내용 |
|
입력 |
카고 서열과 모달리티, 후보 이온화성 지질 또는 조성, 목표 장기와 경로, 선택적으로 기존 습식 실험 데이터 |
|
실행 |
한 명령으로 전체 퍼널 실행. 변이체별 채점·체크포인트. 중단 후 재개 가능 |
|
산출 |
캘리브레이션된 성공확률과 신용구간, 특성별 등급, 규격표, 플레이트 맵, 합성 주문서를 담은 순위표 |
|
결정 |
규제 공백이 이미 열거된 상태에서 가장 유망하고 가장 제조 가능한 후보를 합성 대상으로 선정 |
|
되먹임 |
습식 실험 결과를 GC-LEARN에 반환해 사후분포를 갱신하고 차기 제안 배치를 수령 |
· 전체 순위표 - 모든 변이체, 성공확률과 신용 하한, 모든 채점 축, 명시적 미판정 표시
· 습식 실험 우선순위표 - 적격성 필터 통과 상위 후보. 실패양상 비상관 패널 선정 적용, 증거 등급이 1차 정렬 키
· 카고별 분할표 - 모달리티 간이 아니라 모달리티 내 비교가 되도록 분할
· 변이체별 설계 패키지 - 설계 요약, 서열, 지질 조성, FTO 보고서, 벤치 프로토콜, 미세유체 파라미터, 능동 표적화 명세, 바코드·프라이머
· 규격표 - 중요품질특성과 시험법·허용기준, 공백 보고서, 완결도 백분율
· 플레이트 맵과 합성 주문서 - 습식 실험 인계에 즉시 사용 가능
· 실행 매니페스트 - 실행 메타데이터, 카고 분포, 사용된 모듈 버전
· 보고 문서 - 요약·페이로드·조성·제작방법·화학구조·자가조립·평가축·조직분포·CQA 규격 준수·미확정 사항·재현 정보의 11개 절로 구성된 Markdown 및 Word 형식 보고서
이 절이 존재하는 이유는, 플랫폼을 오용하는 가장 유력한 경로가 상태 없이 수치를 읽는 것이기 때문입니다.
1. 값보다 상태 열을 먼저 확인하십시오. 미채점 또는 미판정으로 보고된 축은 가중치가 재정규화로 제외되었습니다. 0이 아니고 통과도 아닙니다.
2. 의사결정에는 신용 하한을 선호하십시오. 점추정값은 플랫폼의 최선의 추측이고, 하한은 얇은 증거를 견디고 남는 값입니다.
3. 확률과 함께 증거 등급을 읽으십시오. 물리 증거가 없는 후보의 높은 확률은 우수한 성능이 아니라 나쁜 점수를 받을 기회가 적었음을 뜻합니다.
4. 공백 보고서를 규격표의 가장 중요한 페이지로 다루십시오. 완결도 백분율이 문서의 얼마가 예측인지 알려 줍니다.
5. 실행을 로그 배너가 아니라 매니페스트로 식별하십시오. 배너의 버전 문자열은 낡았습니다 (10.1절).
6. 플래그가 붙은 행이 제외 의도였는지 확인하십시오. 행은 벤치 목록에서 걸러지면서 전체 표에 남을 수 있고, 플래그가 어느 쪽인지 말해 줍니다.
플랫폼은 출하 시험, 실제 안정성 시험, 무균 미디어 필, 측정 불순물 정량을 대체하지 않습니다. 배치를 인증하지 않고, 규제기관이 품질 증거로 수용할 수 있는 데이터를 생성하지 않으며, 누구에게도 밸리데이션된 분석 수행 의무를 면제하지 않습니다.
플랫폼이 산출하는 모든 수치는 실험 프로그램을 집중시키고 리스크를 낮추기 위한 — 실험실에 어디를 먼저 볼지, 무엇을 주의할지 알려주기 위한 — 예측이며, 실험을 대신하기 위한 것이 아닙니다. 이 정직성은 독자의 판단에 맡기지 않고 소프트웨어에 내장되어 있습니다 — 각 모듈이 출력에 명시적 유보 문구를 지니고, 생성되는 서류가 측정 전용 특성을 계산 대용값으로 조용히 채우지 않고 미해결 공백으로 표시합니다.
아래 표는 논문 방법론·공개 도구·상용 패키지가 통상 요구하거나 충족을 주장하는 요구사항에 대해 플랫폼을 항목별로 비교합니다. 비교 대상은 제품명이 아니라 범주로 기술합니다 — 범주 수준 비교가 더 검증 가능한 주장이고, 특정 벤더 제품을 명명하면 어떤 고객에게도 이득이 없는 기능 대 기능 논쟁을 초래합니다. 측정 방법이나 확립된 스위트가 더 잘하는 항목은 판정에 그대로 적었습니다.
|
요구사항 |
본 플랫폼 |
통상 대안 |
판정 |
|
설계→CMC→습식 인계의 단절 없는 연결 |
부모 스테이지 10 + 하프스테이지 76 + 플레이트 맵·주문서 |
설계 전용 예측기 또는 CMC 전용 품질 시스템 |
통합 |
|
다중 카고 모달리티 |
단일 레지스트리에 치료 모달리티 13종 |
대개 1종 또는 소수 |
더 넓음 |
|
다중 전달체 클래스 |
클래스 5 / 서브타입 17, 클래스 자체를 순위화 |
지질 전용 또는 폴리머 전용 |
포괄적 |
|
물리 기반 구조 예측 |
조대화 자가조립 + 자유에너지 4구간 |
학습 전용 도구는 구조 예측이 없음 |
기전적 |
|
수렴 검정 |
자기상관 보정 포화 검정 + 적응적 정지 |
고정 시간 실행이 표준 |
통계적 |
|
약전 커버리지 |
ICH·USP·Annex 1·수송 규격을 실명 인용한 품질 모듈 42개 |
품질 시스템은 문서를 관리하고 예측기는 해당 기능이 없음 |
포괄적 |
|
설계공간 (QbD) |
카고별 설계공간 분율 + 설정점 강건성 |
범용 실험계획 통계 패키지 |
도메인 특화 |
|
공정능력 |
특성별 계산 + 파이프라인 자체 예측과 결합 |
범용 통계적 공정관리 패키지, 입자 비인식 |
통합 |
|
규제 문서화 |
규격표, 공백 보고서, 완결도 백분율 |
제출 도구는 문서 관리만 담당 |
예측적 |
|
의사결정 융합 |
최약링크 게이팅과 신용구간을 포함한 가중 융합 |
일반적으로 미제공 |
차별적 |
|
불확실도 정량 |
증거 비례 구간. 미판정과 탈락을 분리 |
다수가 점추정만 제공 |
명시적 |
|
부재 처리 |
3상태 반환. 기본값 대입이 아니라 재정규화 |
중립값 기본 설정이 흔하고 대개 문서화되지 않음 |
엄격 |
|
캐시 정합성 |
래퍼 해시·레지스트리 행·서열 해시에 대한 내용 지문 |
거의 다뤄지지 않음. 전면 재계산 또는 무검증 재사용 |
감사 가능 |
|
재현성 |
결정적 시드, 스테이지별 체크포인트, 자동 테스트 1,626건 |
상용 제품은 내부 로직을 비공개 |
감사 가능 |
|
확장성 |
파일당 모듈 1개, 보조 모듈 126개 |
모놀리식 스위트 |
모듈형 |
|
제3자 라이선스 지위 |
모든 구성요소 라이선스를 설치된 원문에서 확인: 23 승인, 1 조건부, 1 미승인, 2 확인필요 (부록 A) |
도구 문서에 아예 기재되지 않는 경우가 많음 |
공개 |
|
측정된 출하 데이터 |
미제공 |
품질 시스템 하의 밸리데이션된 분석 |
대안 우위 |
|
전향적 예측 검증 |
미확립 |
공개 예측기는 흔히 홀드아웃 벤치마크를 보고 |
대안 우위 |
|
법적 FTO 의견 |
자동 예비 스크리닝만 |
특허 변리인 |
대안 우위 |
|
인간 트로피즘 모델 |
설치류 학습 후 전환 |
직접 영장류·인간 영상 연구 |
대안 우위 |
표 13-1. 요구사항 비교. 마지막 네 행은 의도적으로 포함했습니다. 작성 주체가 모든 행에서 승리하는 비교표는 비교가 아니며, 패배 행이 하나도 없는 것을 발견한 독자는 표 전체를 정당하게 할인합니다.
셋은 규제가 아니라 피어리뷰에서 오므로 따로 다룰 값이 있습니다. 논문 심사자가 제기할 항목들입니다.
방법 재현성. 계산 결과는 기술만으로 재현 가능해야 합니다. 플랫폼은 결정성과 보관 스냅샷으로 이를 충족합니다 — 엔진 372개 버전이 보존되어 있어, 과거 어떤 결과도 그것을 산출한 정확한 코드에 대해 재실행할 수 있습니다. 방법 섹션의 버전 번호 한 줄보다 강한 보증입니다.
불확실도 명시. 구간 없는 점 예측은 과학적 주장이 아닙니다. 모든 복합값이 증거량에 비례하는 폭의 신용구간을 지닙니다.
음성·부재 결과 보고. 대부분의 도구 문서가 실패하고 본 문서가 의도적으로 실패하지 않는 지점입니다 — 잠복 모달리티, 판별력 0인 pKa 게이트, 파라미터 없는 지질 9종, 한 캠페인 전체에서 건너뛰어진 스테롤 채점, 낡은 버전 배너, 동시 부하 하 미해결 크래시가 모두 10.1절에 생략 없이 적혀 있습니다.
논문 관행을 충족하지 못하는 지점. 측정 결과에 대한 홀드아웃 전향적 벤치마크가 공개 예측기에 요구되는 기준이며, 플랫폼은 아직 그것을 갖지 못했습니다. 단위테스트 통과와 문헌 방향성 일치는 더 약한 증거이고, 현재 존재하는 것은 그것입니다.
규제 소프트웨어에서 — 그리고 별개로 학술 피어리뷰에서 — 반복되는 요구는 결과가 재현 가능하고 그것을 산출한 과정까지 추적 가능해야 한다는 것입니다. 플랫폼은 그 요구에 사후적으로 맞춘 것이 아니라 그 요구를 중심으로 지어졌습니다. 엔진은 결정적이고 시드가 고정되어 동일 입력이 매 실행 동일 출력을 내며, 모든 스테이지에 체크포인트가 있어 각 값의 출처를 복원할 수 있고, 순수 로직 계층은 가속기나 네트워크 없이 일반 프로세서에서 수 분 내 완주하는 자동 스위트로 뒷받침됩니다.
|
항목 |
값 |
근거 |
|
수집된 테스트 |
1,626 |
스위트 파일 105개에 대한 pytest --collect-only |
|
통과 |
1,589 |
전체 스위트 실행 |
|
실패 |
33 |
동일 실행 |
|
에러 |
6 |
동일 실행 |
|
테스트 파일 |
110 (본 스위트 105 + 도구 계층 5) |
파일 수 |
|
실행 시간 |
프로세서 전용 450-462초, 가속기·네트워크 불필요 |
독립 2회 실행 |
|
결정성 확인 |
2회 실행이 통과/실패/에러 수 동일 |
462.20초와 450.49초 |
|
보관된 엔진 스냅샷 |
372 |
스냅샷 아카이브 |
표 14-1. 본 문서가 기술하는 엔진에 대해 본 문서를 위해 실측한 테스트 현황. 통과 수를 반올림하지 않고 실패를 생략하지 않는 것이 본 문서의 관례입니다.
이 표를 이렇게 쓰는 이유가 있습니다. "모든 테스트 통과"가 읽기에는 좋지만, 확인할 수 없는 독자에게는 아무것도 전달하지 않고 확인할 수 있는 독자에게는 신뢰를 잃습니다. 현재 어떤 모듈이 실패하는지 명명하는 것이 본 문서의 다른 모든 주장을 더 믿을 만하게 만듭니다.
실패 33건과 에러 6건은 산재하지 않습니다. 네 군으로 떨어지며, 33건 중 24건이 한 하위 시스템에 집중됩니다.
|
군 |
건수 |
성격 |
|
단일가닥 RNAi 변형 패리티 |
실패 21 |
레거시 코드 경로가 배포 엔진을 정확히 재현한다고 단정하는 테스트가, 스키마 버전 필드를 포함해 다른 결과 딕셔너리를 발견 |
|
단일가닥 RNAi 옵트인 거동 |
실패 8 |
해당 모달리티가 기본 모달리티 집합에 없다고 단정하는 테스트. 현행 엔진은 포함하고 있음 |
|
활성 모델 결합 |
실패 3 |
모델 스키마 불일치와 아래 기술하는 패리티 실패 2건 |
|
워치독·스냅샷 고정 테스트 |
에러 4 + 수집 에러 2 |
인프라. 14.3절 |
활성 모델 군집이 실질적인 것이며, 낡은 기대가 아니라 미해결 결함입니다. 실패 출력에서 직접 읽은 세 가지 사실:
7. 학습된 모델 체크포인트가 스키마 변경 시 재생성되지 않았습니다. 모듈은 스키마 버전 2를 선언하고 동봉된 체크포인트는 버전 1입니다. 가드가 불일치를 거부하고 의미 차이를 명시합니다 — 버전 1 체크포인트는 어떤 특징을 이진 플래그로 다루는데 현행 모듈은 등급화된 양으로 다룹니다 — 그리고 필요한 재학습 스크립트를 명명합니다. 이것은 스키마 가드가 설계대로 정확히 작동하면서, 릴리스 단계 하나가 누락되었음을 보고하는 것입니다.
8. 채점 함수가 임포트가 아니라 복사본으로 존재합니다. 패리티 가드가 환경 결합 모듈이 *정본 함수 객체*를 보유한다고 단정하는데, 복사본을 발견합니다. 가드 자신의 메시지가 목적을 명시합니다 — "이것이 이 가드가 잡기 위해 존재하는 드리프트다."
9. 복사본이 이미 수치적으로 드리프트했습니다. 같은 패리티 테스트가 siRNA 접합체 사례에서 두 경로를 비교해 허용오차 10^-9에 대해 4.4 × 10^-3의 차이를 발견합니다. 크기는 작고 종류는 명백합니다.
셋을 합치면 3.5절이 캐시 이력에서 끌어낸 것과 같은 교훈이 다른 형태로 나타난 것입니다 — 중복된 로직은 드리프트하고, 학습된 산출물은 그것을 학습시킨 코드의 캐시된 소비자다. 현행 릴리스가 이 활성 모델을 덮도록 캐시 키를 확장한 것은 정확히 그것이 평범한 임포트 4단을 거쳐 채점 스테이지에 도달하기 때문입니다. 테스트 스위트는 이제 대응하는 산출물 — 학습된 체크포인트 — 가 함께 옮겨지지 않았음을 보고하고 있습니다.
본 문서가 주장하지 않는 것. 단일가닥 RNAi 실패 29건이 낡은 테스트 기대(엔진이 의도적으로 변경되었고 테스트가 폐기된 거동을 고정)인지 진짜 회귀(테스트가 옳고 옵트인 게이트가 작동을 멈춤)인지는 여기서 해소되지 않습니다. 실패 출력만으로는 두 해석이 모두 증거와 일치합니다. 정직한 진술은 이 하위 시스템에 실패 어서션 32건이 있고, 원인이 스키마·중복 문제로 특정되었으며, 해소가 미결이라는 것입니다. 단일가닥 RNAi 모달리티에 의존하려는 독자는 이를 수리 중으로 취급해야 합니다. 다른 12종 모달리티는 이 군집의 영향을 받지 않습니다.
스냅샷 고정 테스트가 매달려 있습니다. 테스트 파일 2개가 엔진 스냅샷을 절대 번호 경로로 임포트하기 때문에 수집 단계에서 실패합니다 — 그리고 그 스냅샷들은 이후 보관되었습니다. 파일은 아카이브 디렉토리에 있고 테스트는 프로젝트 루트에서 찾습니다. 옵트인 군의 세 번째 테스트가 같은 방식으로 실패합니다.
이것은 낡은 인덱스 핀과 같은 실패 유형이며 일반화할 값이 있습니다 — 특정 번호 스냅샷을 고정하는 테스트는 그 스냅샷이 보관되는 순간 매달린 참조가 됩니다. 교차 버전 패리티를 단정하는 데 유용한 패턴이고, 잊기 쉬운 유지보수 의무를 동반합니다. 실패가 틀린 답이 아니라 파일 없음으로 나타나기 때문입니다.
한 스위트는 실제 캠페인 구동 중에 돌려서는 안 됩니다. 모니터링 거동을 검사하는 워치독 테스트에서 에러 4건이 발생합니다. 별개로 — 그리고 이것은 결함이 아니라 운영 경고입니다 — 스위트는 플랫폼 자신의 테스트 디렉토리로 범위를 한정해야 합니다. 그 범위 없이 테스트 러너를 호출하면 러너가 스냅샷 아카이브를 발견하고, 거기서 무관한 보관 테스트의 모듈 수준 종료 호출이 수집기를 즉시 종료시킵니다. 본 문서의 측정에서 범위를 잘못 지정한 호출은 표 14-1의 수치를 낸 올바른 범위 실행 전에 허위 에러 1,033건을 산출했습니다. 이 수치를 재현하려는 사람은 실행 범위를 명시적으로 한정해야 합니다.
실행별 재현성을 넘어 개발 과정이 이력을 보존합니다 — 모든 릴리스가 스냅샷되고 이전 스냅샷이 보관되어, 엔진 372개 버전이 유지되며 과거 어떤 결과도 그것을 산출한 정확한 코드에 대해 재현할 수 있습니다. 결정성·체크포인트·광범위한 스위트·보관된 계보가 합쳐져 '작업 과정을 보여라' 기준을 충족하며, 내부 로직을 검사·독립 재실행·감사할 수 없는 폐쇄 제품보다 투명하게 충족합니다.
버전 식별에 관한 유보를 여기서 가장 중요하게 반복합니다 — 프로그램에 버전 상수가 없고, 명령행 설명과 런타임 로그 배너 모두 수백 개정 이전의 릴리스를 표시합니다. 버전 정체성은 파일명, 변경 이력, 실행 매니페스트에서 옵니다. 어떤 코드가 결과를 산출했는지 재구성하는 심사자는 그것들을 사용해야 하며 배너를 신뢰해서는 안 됩니다.
각각이 특정 결함에서 유도되고 각각이 일반화되므로 원칙으로 적습니다.
· 수치가 파일 경계를 넘을 때 불확실도와 출처가 함께 이동합니다. 그렇지 않으면 단순화가 아니라 버그로 취급합니다.
· 조건 분기를 늘리는 대신 산술이 게이트를 결정합니다. 역분산 가중이 게이트로 작동하는 것이 특수 사례의 연쇄보다 견고합니다 — 작성되지 않은 분기는 조용한 통과이기 때문입니다.
· 엡실론은 축의 의미 있는 단위로 설정합니다. 분모가 퇴화할 때 임의의 작은 상수를 넣으면 반올림 오차가 극단적 표준화 점수로 증폭되어 평범한 후보 전부를 배제할 수 있습니다.
· 검증 증거는 산출 시점에 결속합니다. 사후에 붙이는 도장은 정확성을 대가로 소급 적용성을 사는 것입니다.
· 로그는 append이므로 현재 상태는 마지막 항목에서 읽습니다. 첫 일치를 읽으면 가장 낡은 상태를 반환합니다.
· 부재는 표현 가능합니다. 센티넬 값이 아니라 3상태 반환. 누락 수치를 결코 수치로 강제 변환하지 않습니다.
· 학습된 산출물은 그것을 학습시킨 코드의 캐시된 소비자입니다. 14.2절이 이 규칙이 관례가 아니라 가드에 의해 강제되고 있는 현재 사례입니다.
이 플랫폼은 범위가 이례적으로 넓습니다 — 핵산·이온화성 지질 설계, 조대화 동역학에 의한 물리 기반 구조 예측, 그리고 42개 모듈 약전 품질·규제 계층이 하나의 재현 가능한 자체 엔진 안에 있습니다. 이 세 영역이 한 도구 안에서 발견되는 일은 거의 없고, 하나의 의사결정으로 융합되는 일은 더욱 그렇습니다. 그리고 실제로 융합되어 있습니다 — 모든 신호가 하나의 캘리브레이션된 성공확률과 하나의 규격표로 접히므로, 1위인 분자가 동시에 제조·규제 리스크가 이미 열거된 분자입니다.
v4.0의 성격 변화는 한 문장으로 요약됩니다 — 증거 계층이 물리 계층보다 빠르게 성장했습니다. 엔진이 거의 두 배가 되었고, 증가분의 큰 부분은 새로운 물리가 아니라 계산된 수치가 믿을 만한지를 결정하는 기구로 갔습니다 — 수정이 그것에 의존하는 캐시된 소비자에게 도달하게 하는 스키마 버전 캐시, 미측정 축이 통과 축으로 채점되지 않게 하는 3상태 게이트, 후보가 덜 측정되었다는 이유로 이기지 못하게 하는 사전식 증거 등급, 그리고 그것 없이는 프로그램이 기동을 거부하는 구조적 불변식.
이 강조점은 과학적 목표에 부수적인 것이 아니라 과학적 산출물을 사용 가능하게 만드는 것입니다. 8.5절의 실측이 가장 분명한 예입니다 — 존재 축에 대해 재정규화하는 파이프라인은 가장 덜 검사된 후보를 계통적으로 최상위에 놓으며, 어떤 가중치 선택도 이를 수리하지 못합니다. 그 편향을 찾지 않은 플랫폼이라면 자기 목적을 조용히 역전시키는 순위를 출하했을 것이고, 하류의 모든 수치가 어떤 요약 통계로도 드러나지 않는 방식으로 틀렸을 것입니다.
플랫폼은 실험실을 대체하지 않으며, 그럴 목적으로 설계되지 않았습니다. 하는 일은 실험실에 어디를 볼지, 무엇이 제조하기 어려울지, 어떤 규제 항목이 아직 비어 있는지를 — 지질 1 밀리그램도 합성되기 전에 — 알려주는 것입니다. RNA 의약품 개발자에게 그 시점이 핵심의 전부입니다 — 니트로사민 부채, 응집 절벽, 인출 용량 부족을 1상 안정성 배치에서 발견해 1년과 재제형을 쓰는 것과, 같은 부채를 벤치에서 설계로 제거해 오후 한나절을 쓰는 것의 차이입니다.
· [ ] 표적 유전자 또는 카고 서열과 모달리티가 확정되었다
· [ ] 목표 장기와 투여 경로가 정의되었고, 간 기본 전달이 수용 가능한지 포함해 정해졌다
· [ ] 경로를 명시적으로 선언했다 (겉보기 pKa 목표 창을 선택하므로 — 2.4절)
· [ ] 후보 이온화성 지질 집합을 선정했거나 de-novo 생성을 플랫폼에 위임했다
· [ ] 투여 요법(단회 대 반복)을 결정했다 — 항-PEG·지질 축적 축의 개입 여부를 결정한다
· [ ] 의도 보관 조건(냉장/냉동/동결건조)을 고정했다 — 저장수명 축의 기준점이다
· [ ] 콜레스테롤 외 스테롤을 의도한다면 비율만이 아니라 이름을 명시했다 (10.1절)
· [ ] 실행 티어를 선택했고, 비교 대상 모든 후보에 같은 티어를 적용한다 (12.1절)
· [ ] 습식 실험 검증에 투입 가능한 후보 수를 합의했다
· [ ] 기존 습식 실험 데이터를 능동 학습 피드백 형식으로 준비했다
· [ ] FTO 산출물을 법무 검토로 넘기는 내부 경로가 있다
· [ ] 공백 보고서가 명명한 측정 전용 특성에 대한 분석 확보 계획이 있다
· [ ] 산출물을 읽는 사람이 값보다 상태 열을 먼저 확인하고, 실행을 로그 배너가 아니라 매니페스트로 식별할 것을 안다
|
용어 |
정의 |
|
겉보기 pKa |
이온화성 지질이 조립된 입자 표면에서 절반 양성자화되는 pH. 고립 분자 값과 통상 1 pH 단위 이상 다르며, 표면 전하 밀도가 추가 양성자화를 저항하기 때문 |
|
캡슐화 효율 |
입자 내부에 격리된 핵산 카고 분율 — 용매 노출 분율의 여수 |
|
Bleb |
전자밀도가 높은 내부 하부구조. 극저온전자현미경에서 더 높은 발현과 상관되며, 여기서는 단백질 발현 카고의 예상 형태로 사용 |
|
자유에너지 프로파일 |
반응좌표를 따른 자유에너지. 여기서는 여러 위치에서 구속 샘플링하고 평균힘을 적분해 계산 |
|
단백질 코로나 |
입자 표면에 흡착된 혈장 단백질 층 — 생체 내에서 몸이 실제로 인식하는 표면 |
|
선택적 장기 표적화 |
다섯 번째 하전 지질 첨가로 리간드 없이 장기 트로피즘을 이동시키는 것. 전하 부호가 기전이며 코로나 조성을 통해 작용 |
|
가속 혈중 청소 |
1차 투여가 유발한 항-PEG 항체가 후속 투여를 순환에서 빠르게 제거하는 현상 |
|
NDSRI |
니트로사민 원약물 관련 불순물 — 허용 섭취량이 나노그램/일 수준인 규제 우려 코호트에 속함 |
|
평균동역학온도 |
온도 이력을 등가 단일 온도로 환산한 값. 유통 안정성 예산 계산에 사용 |
|
동결농축액 pH |
동결 중 미동결 분율의 pH. 완충 성분이 우선 결정화하면 제형 pH와 1 단위 이상 다를 수 있음 |
|
CQA / CPP |
중요품질특성 / 중요공정파라미터 — 설계공간을 정의하는 두 축 |
|
최약링크 게이트 |
최악 실패 범주에서 유도한 곱셈 벌점. 직렬 과정이 평균이 아니라 최악 단계에 지배됨을 반영 |
|
미판정 / 미채점 |
상류 모듈이 돌지 않아 부재한 값. '탈락'과 구별되며, 기본값 대입이 아니라 가중치 재정규화로 처리 |
|
증거 등급 |
후보가 물리 유도 축을 지니는지 여부. 증거 깊이가 다르면 복합 점수를 비교할 수 없으므로 벤치 인계의 1차 정렬 키로 사용 |
|
지문(fingerprint) |
스테이지 캐시 키를 이루는 내용 해시. 래퍼 코드·레지스트리 행·입력 서열·참조 데이터 버전을 덮음. 지문이 다른 캐시 결과는 재계산 |
본 부록은 좁은 질문 하나에 답합니다 — 플랫폼 운영자가 이 구성요소들을 상업 서비스의 일부로 "실행"할 수 있는가? 범위는 사용(use) 한정입니다. 이 구성요소들을 판매·재실시·재배포하거나 제3자에게 인도되는 제품에 내장하는 행위는 명시적으로 다루지 않습니다.
이 구분이 여기서 대부분의 일을 합니다. 흔히 혼동되므로 분명히 적습니다 — GPL·LGPL의 카피레프트 의무(소스 제공, 라이선스 전파, 고지 의무)는 배포에 의해 발동되며 내부 사용으로는 발동되지 않습니다. 자기 장비에서 GPL 소프트웨어를 돌려 자기 결과를 산출하는 조직에는 배포 의무가 발생하지 않습니다. 따라서 컴플라이언스 체크리스트에서 제약적으로 보이는 라이선스가 실제 사용 형태에서는 전혀 제약이 아닐 수 있고, 반대로 허용적으로 보이는 라이선스가 훨씬 중요한 "사용" 제약을 지닐 수 있습니다. 아래 표에 두 경우가 모두 등장합니다.
모든 항목의 라이선스는 이 시스템에 존재하는 라이선스 원문 또는 패키지 메타데이터에서 읽었으며, '근거' 열이 그 위치를 명시합니다. 로컬에 라이선스 파일이 없는 항목은 단정하지 않고 확인 필요로 표시했습니다.
|
구성요소 |
버전 |
라이선스 |
근거 |
상업적 사용 |
|
GROMACS |
2026.2 |
LGPL-2.1 |
gromacs/share/gromacs/COPYING |
허용 |
|
GROMACS + PLUMED 빌드 |
- |
LGPL-2.1 (GROMACS 트리) |
LNP/gromacs_plumed/share/gromacs/COPYING |
허용 |
|
LAMMPS |
- |
GPL-2.0 |
LNP/lammps/LICENSE |
허용 (카피레프트는 배포에만 적용) |
|
packmol |
- |
MIT |
LNP/packmol/LICENSE |
허용 |
|
martinize2 / vermouth |
0.15.0 |
Apache-2.0 |
패키지 메타데이터 |
허용 |
|
polyply |
1.8.0 |
Apache-2.0 |
패키지 메타데이터 |
허용 |
|
RDKit |
2024.9.6 |
BSD-3-Clause |
패키지 메타데이터 |
허용 |
|
MDAnalysis |
2.10.0 |
LGPL-3.0+ |
패키지 메타데이터 |
허용 (카피레프트는 배포에만) |
|
NumPy |
2.3.5 |
BSD-3-Clause |
패키지 메타데이터 |
허용 |
|
SciPy |
1.16.1 |
BSD-3-Clause |
패키지 메타데이터 |
허용 |
|
PyTorch |
2.6.0 |
BSD-3-Clause |
패키지 메타데이터 |
허용 |
|
PyTorch Geometric |
2.7.0 |
MIT |
프로젝트 라이선스 |
허용 |
|
Transformers |
4.48.1 |
Apache-2.0 |
패키지 메타데이터 |
허용 |
|
DeepChem |
2.5.0 |
MIT |
패키지 메타데이터 |
허용 |
|
OpenMM |
8.5.1 |
MIT 계열 |
패키지 메타데이터 |
허용 |
|
PROPKA |
3.5.1 |
LGPL-2.1 |
패키지 메타데이터 |
허용 (카피레프트는 배포에만) |
|
mordredcommunity |
2.0.7 |
BSD-3-Clause |
패키지 메타데이터 |
허용 |
|
Boltz-2 |
2.2.1 |
MIT |
boltz-2.2.1.dist-info/licenses/LICENSE |
허용 |
|
AGILE |
- |
MIT |
LNP/AGILE/LICENSE |
허용 |
|
NWChem |
7.3.1 |
ECL-2.0 (Apache-2.0 파생) |
drug_discovery_tools/nwchem-7.3.1/LICENSE.TXT |
허용 |
|
Biopython |
1.85 |
Biopython 라이선스 (BSD 계열) |
패키지 메타데이터 |
허용 |
|
python-docx |
1.2.0 |
MIT |
패키지 메타데이터 |
허용 |
|
haddock3 (구동 드라이버) |
- |
Apache-2.0 |
모듈 라이선스 주석 |
허용 — 단, 그것이 구동하는 엔진은 A.4 참조 |
표 A-1. 사용 한정 범위에서 라이선스가 상업적 사용을 허용하는 구성요소.
ViennaRNA 2.7.0은 OSI 승인 라이선스가 아니므로 표의 한 행이 아니라 별도 항목이 필요합니다. 설치된 패키지 메타데이터에서 읽은 라이선스 원문은 사용을 명시적으로 허가합니다:
> "Permission is granted for research, educational, and commercial use and modification so long as 1) the package and any derived works are not redistributed for any fee, other than media costs, 2) proper credit is given to the authors and the Institute for Theoretical Chemistry of the University of Vienna."
그리고 이어서:
> "If you want to include this software in a commercial product, please contact the authors."
본 부록의 사용 한정 범위에서 지위는 따라서 허용이며, 살아 있는 의무가 둘입니다 — 패키지를 유료로 재배포하지 않을 것, 그리고 저자와 빈 대학교 이론화학연구소를 명시 인용할 것. "저자에게 연락하라"는 문장은 소프트웨어를 상업 제품에 포함시키는 경우, 즉 배포에 붙으며, 플랫폼이 서비스로 운영되는 대신 패키징되어 출하되는 순간 발동됩니다. 그런 사업 모델 변경을 검토하는 사람은 이를 해소된 사항이 아니라 미해결 항목으로 취급해야 합니다.
본 부록에서 상업적 사용이 승인되지 않은 유일한 항목이며, 카피레프트 사례들과 달리 제약이 사용에 걸리므로 범위를 좁히는 것으로 해소되지 않습니다.
예측된 리간드-수용체 포즈에 대한 플랫폼의 역장(force-field) 교차검증은 haddock3로 구동되며, haddock3 자체는 Apache-2.0으로 문제가 없습니다. 그러나 사용되는 두 모듈 — 토폴로지 생성과 에너지 최소화 채점 — 은 모두 CNS(Crystallography & NMR System) 엔진의 모듈이고, CNS는 비영리 사용에만 무료입니다. 상업적 배포에는 BIOVIA로부터의 CNS 라이선스가 필요합니다.
플랫폼 자체 소스가 이 의무를 컴플라이언스 문서가 아니라 사용 지점에 기록하고 있으며, 그에 대해 내려진 결정까지 기록하므로 인용할 값이 있습니다:
> "LICENCE NOTE: haddock3 itself is Apache-2.0, but the CNS binary it drives is free only for non-profit use; topoaa and emscoring — the two modules used here — are both CNS modules. Commercial deployment needs a CNS licence from BIOVIA. Wiring it in was an explicit instruction; this note records the obligation, it does not gate the code."
고객이나 인수자가 필요로 할 것이므로 세 가지 결과를 분명히 적습니다:
10. 코드가 이를 강제하지 않습니다. 주석이 게이트하지 않는다고 명시합니다. 상업적 실행은 CNS를 호출해 수치를 산출하며 소프트웨어는 아무 이의도 제기하지 않습니다. 의무는 기술적이 아니라 조직적입니다.
11. 축 하나에 국한됩니다. CNS는 표적화 헤드 결합 포즈에 대한 역장 2차 의견을 통해서만 도달됩니다. 본 문서의 다른 모든 축 — 품질 계층 전체, 순위, 자유에너지 배터리, 구조 예측, 코로나 모델 — 은 CNS를 쓰지 않습니다. 그 교차검증 하나를 비활성화하면 파이프라인의 다른 어떤 것도 건드리지 않고 의무가 제거되며, 대가는 그 축이 독립 검증 없는 단일 학습 신뢰도로 되돌아가는 것입니다.
12. 해결책은 재작성이 아니라 라이선스입니다. BIOVIA의 CNS 라이선스가 이를 해소합니다. 취득하지 않는다면 정직한 선택지는 그 축을 미채점으로 두는 것, 또는 역장 의견을 허용적 라이선스 구성요소로 대체하는 것입니다.
바이너리 2개가 라이선스 파일 없이 설치되어 있어 이 시스템에서 조건을 확인할 수 없었으며, 따라서 여기서 단정하지 않습니다.
|
구성요소 |
상태 |
확인 필요 사항 |
|
AutoDock Vina |
drug_discovery_tools/vina/bin/vina 존재, 라이선스 파일 없음 |
설치된 정확한 빌드의 라이선스 확인 [검증 필요] |
|
gnina |
drug_discovery_tools/gnina 존재 (단일 바이너리, 라이선스 파일 없음) |
gnina 자체 라이선스 그리고 정적 링크된 구성요소들의 라이선스 — 후자는 전자와 다를 수 있음 [검증 필요] |
표 A-2. 이 시스템에서 라이선스를 읽을 수 없었던 구성요소.
두 번째 행은 명명할 값이 있는 일반적 주의를 담고 있습니다 — 정적 링크된 단일 과학 바이너리는 컴파일되어 들어간 모든 것의 라이선스 의무를 함께 지닐 수 있고, 그 의무는 실행 파일만 봐서는 보이지 않습니다. 그런 바이너리의 지위를 확정하려면 파일명이 아니라 빌드 매니페스트를 봐야 합니다.
|
분류 |
개수 |
|
상업적 사용 승인 (사용 한정 범위) |
23 |
|
인용·무료재배포금지 조건부 허용 |
1 (ViennaRNA) |
|
미승인 — 상업적 사용에 유료 라이선스 필요 |
1 (HADDOCK 경유 CNS) |
|
확인 필요 |
2 (AutoDock Vina, gnina) |
실행 가능한 결론. 자체 운영 서비스라면 스택은 예외 1건과 조건 1건을 빼고 라이선스가 깨끗합니다. 예외인 CNS는 정확히 채점 축 하나에만 영향을 주고, 소스의 사용 지점에 문서화되어 있으며, BIOVIA 라이선스 취득 또는 그 교차검증 하나의 비활성화로 해소됩니다. 조건인 ViennaRNA 인용은 크레딧 한 줄의 비용입니다. 어느 것도 플랫폼 아키텍처를 변경할 이유가 아니며, 실사 도중이 아니라 그 전에 알 수 있도록 여기에 적었습니다.
면책. 모든 in-silico 산출물은 트리아지와 우선순위화를 위한 예측 휴리스틱이며 측정된 출하 데이터가 아닙니다. 밸리데이션된 방법에 의한 약전 확증이 여전히 요구됩니다. FTO 산출물은 자동 예비 스크리닝이며 법적 의견이 아닙니다. 10.1절의 한계와 14.2절의 실패 테스트 군은 본 문서의 사실 내용의 일부이며, 특정 축에 의존하기 전에 읽어야 합니다.