통찰력 있는 사람들이 함께하는 젊고 열정적인 IT 기업, 비젠소프트.
A young and passionate technology company,
brought together by people with keen insight—this is Vizensoft.
말라리아·결핵 AI 신약, 클로드 43.7점 초기 데이터 의미 - TL;DR: 허깅페이스에 공개된 AI 신약발견 챌린지 'Open Discovery Challenge'에서 클로
# 말라리아·결핵 AI 신약, 클로드 43.7점 초기 데이터가 던진 질문
---
TL;DR: 허깅페이스에 공개된 AI 신약발견 챌린지 'Open Discovery Challenge'에서 클로드 계열 AI를 활용한 제출물이 말라리아·결핵 두 질환 모두에서 챗GPT(OpenAI) 계열보다 높은 점수를 기록했습니다. 말라리아 시즌에서는 클로드 43.7점 대 OpenAI 31.7점, 결핵 시즌에서는 클로드 39.9점 대 OpenAI 30.9점으로, 두 질환에서 동일한 순서가 반복됐습니다.
이 프로젝트는 국내 AI 스타트업 비드래프트(VIDRAFT)가 만들어 허깅페이스에 공개한 것으로, 공개 3일 만에 2,000건 이상의 후보 분자가 제출되며 빠르게 화제가 됐습니다. 전자신문이 2026년 8월 18일자로 이를 보도했고, 비드래프트는 8월 19일 서울에서 관련 보도자료를 배포했습니다.
다만 이 수치는 어디까지나 공개 직후 초기 데이터입니다. 표본 크기와 세부 모델 버전은 공개되지 않았고, 챌린지는 여전히 진행 중이라 앞으로 순위가 바뀔 가능성도 충분합니다. 이 글에서는 이 프로젝트가 왜 만들어졌는지, 초기 데이터가 왜 의미 있는지, 그리고 AI 신약발견 시장이 앞으로 어떻게 움직일지를 정리했습니다.

AI 신약발견 분야가 고정된 문제풀이형 벤치마크에서 실제 신약 후보를 겨루는 개방형 경쟁 구조로 전환되고 있다는 점이 이번 이슈의 핵심 배경입니다. 기존에는 정해진 데이터셋 안에서 AI 모델이 얼마나 정확한 예측을 내놓는지를 겨루는 벤치마크가 대부분이었습니다. 하지만 Open Discovery Challenge는 참가자가 각자 선택한 AI(OpenAI, Claude, Gemini, DeepSeek, Qwen, KIMI 또는 자체 개발 AI)를 활용해 화학 공간을 자유롭게 탐색하고, 실제 후보 화합물을 직접 제출하는 방식을 택했습니다.
이 프로젝트가 말라리아와 결핵을 초기 대상 질환으로 삼은 배경에는 세계보건기구(WHO)의 오랜 지적이 자리합니다. 저소득·취약계층에 질병 부담이 집중되는 감염병은 시장 수익성이 낮아 민간 제약사의 연구개발(R&D) 유인이 충분하지 않다는 구조적 문제입니다. 말라리아와 결핵은 대표적인 '방치된 열대질환(Neglected Tropical Disease)' 인접 질환으로, 매년 수백만 명이 감염되고 있음에도 신약 파이프라인은 상대적으로 얇았습니다. 비드래프트는 이 공백을 AI 기반 오픈 챌린지로 메워보려는 시도를 한 셈입니다.
주목할 부분은 확산 속도입니다. 허깅페이스에 공개된 지 3일 만에 2,000건 이상의 후보 분자가 제출됐다는 사실은 AI 신약발견 커뮤니티가 이런 개방형 참여 구조에 얼마나 즉각적으로 반응하는지를 보여줍니다. 참가자들은 화면 앞에서 실험실 장비 없이도 AI 모델을 활용해 약효 가능성, 독성, 표적 결합도, ADME(흡수·분포·대사·배설) 같은 전임상 지표를 시뮬레이션할 수 있었고, 이 결과가 곧바로 점수와 순위로 공개되는 구조였습니다.

말라리아·결핵 두 개의 서로 다른 질환에서 클로드 계열이 OpenAI 계열보다 앞서는 동일한 패턴이 나타났다는 점이 이번 데이터의 핵심입니다. 이는 단순한 우연이라고만 보기엔 반복성이 있다는 뜻이고, 동시에 여전히 초기 데이터라 단정하기엔 이르다는 두 가지 해석이 동시에 성립합니다.
구체적인 수치를 보면 다음과 같습니다.
말라리아 시즌(Season 1)에서는 Claude 계열 제출물의 중앙값이 43.7점으로 가장 높았고, OpenAI 계열은 31.7점을 기록해 약 12.1점 차이가 났습니다.
결핵 시즌(Season 2)에서도 같은 순서가 반복됐습니다. Claude 계열은 39.9점, OpenAI 계열은 30.9점으로, 절대 점수는 다르지만 격차의 방향성은 동일했습니다.
이 점수는 약효 가능성, 독성, 표적 결합도, ADME 시뮬레이션 결과를 종합한 지표로 추정되며, 후보 물질이 실제 전임상·임상 단계로 넘어갈 가능성을 정량화한 값입니다. 다만 어떤 세부 알고리즘으로 이 점수가 산출됐는지, 표본이 정확히 몇 건이었는지는 비드래프트 발표 자료에서 명확히 공개되지 않았습니다.
여기서 중요한 것은 이 수치가 '초기 데이터'라는 점을 프로젝트 측도 함께 전달했다는 사실입니다. 서로 다른 두 질환에서 같은 경향이 나타난 만큼 데이터가 누적될수록 결과의 의미가 커질 것이라는 취지가 함께 언급됐습니다. 표본 크기가 작은 상태에서 나온 결과이기 때문에, 이 수치만으로 특정 AI 모델이 신약발견 능력에서 절대적으로 우월하다고 결론 내리기는 아직 어렵습니다. 또한 어떤 버전의 클로드, 어떤 버전의 GPT 계열 모델이 사용됐는지도 공개되지 않아 세부 비교에는 한계가 있습니다.


이번 챌린지의 실질적 주도자는 국내 AI 스타트업 비드래프트이며, 이 프로젝트를 통해 국내 기업이 글로벌 AI 신약발견 벤치마크 논의에 이름을 올렸다는 점이 주목할 대목입니다. 비드래프트는 허깅페이스라는 글로벌 오픈소스 AI 커뮤니티 플랫폼을 무대로 삼아, 특정 기업이나 연구기관이 독점하던 신약발견 실험을 개방형 대회 형식으로 전환했습니다.
이 생태계를 구성하는 플레이어는 크게 세 갈래로 나눌 수 있습니다.
첫째, 챌린지 운영 주체입니다. 비드래프트는 규칙 설계, 점수 산정 기준 마련, 리더보드 운영을 담당하며 말라리아(Season 1)와 결핵(Season 2)이라는 초기 대상 질환을 직접 선정했습니다. 앞으로 대상 질환을 확장할지, 점수 산정 방식을 고도화할지는 운영 주체의 후속 발표에 달려 있습니다.
둘째, 참가자 그룹입니다. 참가자들은 자신이 선택한 AI 모델—OpenAI, Claude, Gemini, DeepSeek, Qwen, KIMI 또는 자체 개발 모델—을 활용해 후보 분자를 탐색하고 제출합니다. 3일 만에 2,000건 이상이 몰렸다는 것은 이 참가자 풀이 결코 작지 않다는 뜻이며, 학계 연구자부터 개인 개발자, AI 신약발견에 관심 있는 화학·생명공학 배경의 커뮤니티까지 다양한 층위가 참여했을 가능성이 높습니다.
셋째, 기반 AI 모델 제공사들입니다. 이번 초기 데이터에서 회자된 것은 Claude 계열과 OpenAI 계열의 격차지만, 챌린지 자체는 Gemini, DeepSeek, Qwen, KIMI 등 더 폭넓은 모델군을 참가 대상으로 열어두고 있습니다. 즉 지금 공개된 두 모델군의 비교는 전체 그림의 일부일 뿐이며, 다른 모델 계열의 성과가 아직 충분히 조명되지 않았을 가능성도 있습니다.
이 구조에서 흥미로운 점은, 신약발견이라는 고도로 전문화된 영역에서 벤치마크 운영권 자체가 특정 국가·기업에 종속되지 않고 오픈소스 플랫폼 위에서 누구나 검증할 수 있는 형태로 열렸다는 것입니다. 이는 향후 AI 모델 제공사들이 자사 모델의 신약발견 역량을 마케팅 포인트로 활용할 유인을 만들 수도 있고, 반대로 특정 모델군에 불리한 결과가 나올 경우 벤치마크 설계 자체에 대한 이의 제기로 이어질 수도 있는 구조입니다.

대형언어모델의 추론 능력이 고전적 신약발견 파이프라인의 일부 단계를 대체하거나 가속화할 수 있는 수준까지 올라왔다는 점이 이번 챌린지가 성립할 수 있었던 기술적 배경입니다. 전통적인 신약발견은 화학자와 생물학자가 수년에 걸쳐 후보 물질을 합성하고 실험실에서 검증하는 과정을 거칩니다. 이 과정에서 표적 결합도, 독성, ADME 특성을 예측하는 계산화학·시뮬레이션 도구는 이미 오래전부터 존재했지만, 이를 대형언어모델과 결합해 자연어 기반으로 화학 공간을 탐색하는 방식은 상대적으로 최근의 흐름입니다.
Open Discovery Challenge가 요구하는 프로세스를 단계별로 보면 이렇습니다.
먼저, AI 모델이 기존 화합물 데이터베이스와 질환 관련 생물학적 정보를 학습한 지식을 바탕으로 새로운 분자 구조 후보를 제안합니다.
다음으로, 제안된 분자에 대해 약효 가능성과 표적 결합도를 시뮬레이션합니다.
그리고 독성 예측과 ADME(흡수·분포·대사·배설) 특성을 함께 평가합니다.
마지막으로, 이 모든 결과를 종합해 전임상·임상 가능성을 점수화하고 리더보드에 반영합니다.
이 전체 파이프라인에서 AI 모델의 역할은 단순 검색이나 요약을 넘어, 화학적 타당성을 판단하는 추론 단계까지 관여한다는 점이 핵심입니다. 클로드와 OpenAI 계열의 점수 격차가 두 질환에서 반복됐다는 것은, 적어도 이 챌린지의 평가 방식 안에서는 모델별 추론 방식의 차이가 화학 공간 탐색 결과물의 질에 실제로 영향을 줬을 가능성을 시사합니다. 다만 이는 특정 프롬프트 설계, 참가자의 활용 숙련도 등 변수가 섞여 있을 수 있어, 모델 자체의 절대적 우열로 단순화하긴 어렵습니다.

민간 제약사가 수익성 낮은 감염병 신약 개발을 기피해온 구조적 공백을, AI 기반 오픈 챌린지가 대체 자원 동원 방식으로 파고들고 있다는 점이 시장적 배경입니다. WHO는 오랫동안 저소득·취약계층에 집중되는 질병일수록 시장 논리로는 신약 개발 유인이 부족하다는 점을 지적해왔습니다. 말라리아와 결핵은 감염 규모에 비해 신약 파이프라인이 얇았던 대표적 질환군입니다.
이런 구조에서 Open Discovery Challenge 같은 오픈 이노베이션 모델이 갖는 시장적 의미는 다음과 같이 정리할 수 있습니다.
첫째, 연구개발 비용을 분산시킵니다. 대형 제약사가 독자적으로 수백억 원을 투입해야 할 초기 후보물질 발굴 단계를, 전 세계 참가자들이 각자의 AI 도구를 활용해 동시다발적으로 수행하게 함으로써 초기 탐색 비용을 크게 낮출 수 있습니다.
둘째, 참여 장벽을 낮춰 다양한 아이디어를 확보합니다. 3일 만에 2,000건 이상의 후보물질이 제출됐다는 것은 기존 제약사 내부 R&D팀 규모로는 단기간에 도달하기 어려운 양적 성과입니다.
셋째, AI 모델 제공사 입장에서는 새로운 검증 무대가 열린 셈입니다. 자사 모델이 실제 신약발견 맥락에서 어떤 성과를 내는지 공개 리더보드로 검증받을 수 있는 기회이기 때문에, 향후 이런 유형의 챌린지에 AI 모델 제공사들이 더 적극적으로 관심을 가질 유인이 생깁니다.
다만 이 모델에도 한계는 분명합니다. AI가 제안한 후보 분자가 실제 전임상·임상 단계로 이어지려면 여전히 막대한 시간과 비용, 그리고 실제 실험실 검증이 필요합니다. 챌린지에서 나온 점수는 시뮬레이션 기반 예측치일 뿐, 실제 약효를 보장하지 않는다는 점을 참가자와 관찰자 모두 유념해야 합니다.

전자신문 보도와 비드래프트 발표 모두 공통적으로 강조하는 지점은 '경향성은 주목할 만하지만 아직 확정할 단계는 아니다'라는 신중한 태도입니다. 이는 단일 실험이 아니라 말라리아와 결핵이라는 서로 다른 질환 영역에서 동일한 순서(Claude 우위, OpenAI 열위)가 반복됐다는 사실 자체가 주목받을 이유이면서도, 동시에 표본 규모와 모델 버전이 명확히 공개되지 않은 초기 데이터라는 한계를 함께 지적하는 맥락입니다.
전자신문 원문 기사 제목 자체가 "말라리아·결핵 실제 신약 후보 경쟁서 클로드 계열 선두"였다는 점에서, 언론 보도의 프레이밍도 '현재까지의 선두'라는 시점 한정적 표현을 택했습니다. 이는 향후 데이터가 누적되면서 순위가 바뀔 가능성을 열어두는 신중한 화법으로 해석할 수 있습니다.
비드래프트 측 발표 취지 역시, 서로 다른 두 질환에서 같은 경향이 나타난 것은 우연이라기엔 반복성이 있지만 데이터가 누적될수록 그 의미가 더 커질 것이라는 방향으로 정리됩니다. 다시 말해 이번 초기 데이터는 "결론"이 아니라 "관찰"에 가깝다는 것이 프로젝트 측과 보도 양쪽에서 공통적으로 읽히는 톤입니다.
이런 신중함은 AI 신약발견 벤치마크가 아직 표준화된 평가 체계를 갖추지 못한 초기 단계 산업이라는 점과도 맞닿아 있습니다. 어떤 모델 버전이 사용됐는지, 참가자의 프롬프트 활용 방식이 결과에 얼마나 영향을 미쳤는지 등 통제되지 않은 변수가 많은 만큼, 이 수치를 절대적 모델 성능 순위로 받아들이기보다는 앞으로 지켜봐야 할 초기 신호로 받아들이는 것이 합리적인 접근입니다.

단기적으로는 참여자 수와 제출물이 계속 누적되면서 현재의 클로드 우위 경향이 유지될지, 아니면 표본이 커지면서 격차가 좁혀지거나 순위가 뒤바뀔지가 가장 주목할 관전 포인트입니다. 2026년 8월 기준 공식 사이트에서는 시즌1(말라리아)과 시즌2(결핵) 모두 참가가 진행 중이며, 표본이 계속 늘어나는 상태입니다.
향후 6~12개월 동안 예상해볼 수 있는 시나리오는 다음과 같습니다.
시나리오 1: 경향성 유지 및 강화. 참여자가 늘어나도 클로드 계열의 우위가 유지된다면, 이는 특정 AI 모델의 화학적 추론 능력이 실질적으로 우수하다는 신호로 받아들여질 가능성이 커집니다. 이 경우 AI 모델 제공사들이 이를 마케팅 지표로 활용할 수도 있습니다.
시나리오 2: 표본 확대에 따른 격차 축소. 표본이 수만 건 단위로 늘어나면 초기 몇천 건에서 나타난 극단적 격차가 평균으로 수렴하며 좁혀질 가능성도 있습니다. 통계적으로 초기 소표본 결과는 흔히 후속 데이터에서 조정되는 경향이 있습니다.
시나리오 3: 대상 질환 확장. 비드래프트가 말라리아·결핵 외에 다른 감염병이나 희귀질환으로 챌린지를 확장할 가능성도 배제할 수 없습니다. 이 경우 시즌3, 시즌4가 새로운 벤치마크 데이터를 추가로 만들어낼 것입니다.
시나리오 4: 제3자 검증 시도. 현재까지 이 수치는 비드래프트 발표와 이를 전한 언론 보도에 근거하며, 독립적인 제3자 검증 자료는 확인되지 않았습니다. 학계나 독립 연구기관이 이 데이터셋을 활용해 별도 분석을 내놓을 가능성도 열려 있습니다.
독자 입장에서는 최신 공식 리더보드를 직접 확인하는 습관이 중요합니다. 이 글에서 인용한 43.7점, 31.7점, 39.9점, 30.9점은 2026년 8월 중순 공개 직후 3일간의 초기 데이터이며, 발행 시점에는 이미 순위나 점수가 달라졌을 가능성이 있습니다.

중장기적으로는 AI 기반 화학 공간 탐색이 초기 후보물질 발굴 단계에서 표준 도구로 자리 잡을 가능성이 높으며, 이번 챌린지는 그 과정에서 나온 초기 벤치마크 사례로 기록될 가능성이 있습니다. 다만 AI가 제안한 후보물질이 실제 신약으로 승인받기까지는 임상시험이라는 별도의 긴 여정이 남아 있어, AI의 역할은 여전히 '발견 가속화'에 한정될 가능성이 높습니다.
3~5년 관점에서 그려볼 수 있는 흐름은 이렇습니다.
먼저, 오픈소스 신약발견 챌린지가 하나의 산업 표준 벤치마크 카테고리로 자리 잡을 가능성입니다. 지금은 비드래프트라는 특정 스타트업이 주도하고 있지만, 유사한 형태의 공개형 챌린지가 다른 기관이나 컨소시엄에 의해 추가로 등장할 수 있습니다.
다음으로, 저소득 국가 감염병 신약 파이프라인의 실질적 확대입니다. 만약 이런 오픈 챌린지에서 나온 후보물질 중 일부가 실제 전임상 단계로 넘어가 성과를 낸다면, 시장 논리로는 외면받던 질환 영역에 대한 R&D 투자 유인이 새로운 방식으로 만들어질 수 있습니다.
마지막으로, AI 모델 간 경쟁 구도가 신약발견이라는 구체적 응용 영역으로 세분화될 가능성입니다. 현재 범용 대화형 AI 성능 비교에 집중됐던 클로드-챗GPT 비교 논의가, 신약발견·법률·의료 등 전문 영역별 세분화된 벤치마크로 확장되는 흐름의 초기 사례로 이번 챌린지가 남을 수 있습니다.
물론 이 모든 시나리오는 현재 시점에서 확정된 것이 아니라 가능성 차원의 전망입니다. 실제 전개는 표본 데이터 누적, 실제 임상 진입 성과, 그리고 AI 모델 자체의 발전 속도에 따라 크게 달라질 수 있습니다.

AI 신약발견을 지켜보거나 관련 업무에 활용하려는 입장이라면, 이번 초기 데이터를 '특정 모델의 절대적 우열 증명'이 아니라 '앞으로 검증이 필요한 신호'로 받아들이는 태도가 중요합니다. 실무적으로 참고할 만한 행동은 다음과 같습니다.
첫째, 공식 리더보드를 직접 확인하세요. 허깅페이스에 공개된 Open Discovery Challenge 페이지는 실시간으로 업데이트되므로, 이 글에서 인용한 수치보다 최신 데이터를 확인하는 것이 정확합니다.
둘째, 모델별 특성을 맹신하지 마세요. 표본이 적은 초기 단계에서는 특정 모델이 우연히 좋은 결과를 냈을 가능성도 배제할 수 없습니다. 시간이 지나며 표본이 늘어나는 과정을 함께 지켜보는 것이 합리적입니다.
셋째, 오픈 이노베이션 구조 자체에 주목하세요. AI 모델 성능 비교보다 더 중요한 것은, 이런 개방형 챌린지가 공익적 R&D 공백을 메우는 새로운 방식이 될 수 있다는 구조적 가능성입니다.

Q1. Open Discovery Challenge는 누구나 참가할 수 있나요?
A. 허깅페이스에 공개된 프로젝트이며, 참가자가 OpenAI, Claude, Gemini, DeepSeek, Qwen, KIMI 또는 자체 개발 AI를 활용해 후보 분자를 제출하는 개방형 구조입니다. 세부 참가 자격과 절차는 공식 페이지에서 확인하는 것이 정확합니다.
Q2. 클로드 43.7점, OpenAI 31.7점이라는 수치는 지금도 유효한가요?
A. 아닙니다. 이 수치는 2026년 8월 공개 직후 3일간의 초기 데이터입니다. 챌린지는 현재도 진행 중이며 표본이 계속 늘어나고 있어, 최신 공식 리더보드를 확인해야 정확합니다.
Q3. 이 점수가 높다고 실제 신약이 되는 건가요?
A. 아닙니다. 이 점수는 약효 가능성, 독성, 표적 결합도, ADME 등을 종합한 시뮬레이션 기반 예측치입니다. 실제 신약으로 이어지려면 전임상·임상시험이라는 별도의 긴 검증 과정이 필요합니다.
Q4. 왜 말라리아와 결핵을 선택했나요?
A. 저소득·취약계층에 질병 부담이 집중되는 감염병일수록 시장 수익성이 낮아 민간 제약사의 R&D 유인이 부족하다는 WHO의 오랜 지적을 배경으로, 공익적 목적에서 초기 대상 질환으로 선정됐습니다.
Q5. 이 결과를 어디서 직접 확인할 수 있나요?
A. 허깅페이스에 공개된 Open Discovery Challenge 페이지와 비드래프트 공식 사이트(vidraft.net)에서 최신 리더보드를 확인할 수 있습니다.
- 전자신문(etnews.com), "말라리아·결핵 실제 신약 후보 경쟁서 클로드 계열 선두", 2026년 8월 18일자
- 비드래프트 공식 사이트(vidraft.net), 2026년 8월 19일 보도자료(서울)
- openpr.com, ktbs.com 보도자료 배포 (GetNews 경유 제3자 제공 콘텐츠, 정확성 책임 고지 포함)
- 세계보건기구(WHO) 방치된 열대질환 관련 R&D 유인 부족 지적 (배경 맥락)
※ 본문에 인용된 수치(43.7점, 31.7점, 39.9점, 30.9점, 2,000건 이상)는 비드래프트 발표 및 이를 전한 언론 보도에 근거하며, 독립적인 제3자 검증 자료는 확인되지 않았습니다. 발행 시점 기준 최신 공식 리더보드 재확인을 권장합니다.