AI News

OpenAI가 컴퓨테이셔널 생물학에서 AI 시스템이 단순히 스크립트화된 분석을 실행하는 것 이상을 할 수 있는지 테스트하도록 설계된 새로운 벤치마크 GeneBench-Pro를 소개했다. 회사에 따르면 이 벤치마크는 모델이 모호성을 어떻게 다루는지, 가정을 어떻게 수정하는지, 어떤 방법을 선택하는지, 그리고 답변이 하류 과학적 의사결정에 사용할 만큼 신뢰할 수 있는지를 언제 판단하는지 측정하는 것을 목표로 한다.

이번 공개가 중요한 이유는 기존 AI 평가들이 잘 다루지 못하는 공백을 겨냥하기 때문이다. 그 공백은 반복적이고, 지저분하며, 사전에 완전히 명세되지 않은 연구 작업이다. OpenAI는 GeneBench-Pro가 이전의 GeneBench 작업을 더 어려운 과제로 확장했으며, 실제 과학 분석을 형성하는 판단을 반영하도록 구축된 데이터셋과 프롬프트를 사용해 유전체학, 정량 생물학, 중개 의학 전반의 과제를 포함한다고 말한다. 생명과학 분야에서 일하는 AI 개발자와 기업 팀에게 이번 소식은 화려한 모델 출시라기보다, 벤치마크 조건에서 “유용한” 과학적 추론이 어떤 모습이어야 하는지를 새롭게 정의하려는 시도에 가깝다.

OpenAI가 무엇을 출시하는가

OpenAI의 설명에 따르면, GeneBench-Pro는 컴퓨테이셔널 생물학 활용 사례를 아우르는 129개 문항으로 구성된 연구 수준의 벤치마크다. 각 문제는 AI 에이전트에게 짧은 프롬프트, 데이터 파일, 그리고 Python, 과학 컴퓨팅 라이브러리, PLINK 2.0 같은 유전체 도구를 포함한 표준 분석 환경에 대한 접근 권한을 제공한다. 이후 모델은 데이터를 탐색하고, 분석 경로를 선택하고, 초기 가정이 실패하면 반복적으로 수정하며, 최종 답변을 반환해야 한다.

이러한 구도는 OpenAI의 핵심 주장에서 중심적인 역할을 한다. 회사는 많은 과학 과제가 사실 기억력이나 체크리스트를 따르는 능력의 한계가 아니라, 데이터가 무엇을 뒷받침할 수 있는지, 진단이 초기 계획을 무효화하는지, 대안 추정량이나 방법 사이에서 어떻게 절충할지를 판단하는 일련의 판단, 즉 자신들이 말하는 “research taste”에 의해 제약된다고 주장한다. GeneBench-Pro는 단순한 최종 결과물보다 이러한 시스템 수준의 결정을 측정하도록 의도됐다.

OpenAI는 또한 “Inside Genebench-Pro”라는 보조 사례 연구 페이지를 공개했으며, 여기에는 10개의 대표 사례가 담겨 있다. 이 사례들은 회사가 평가하고자 하는 과제의 스타일을 보여준다. 예를 들면, 합성 종양 레지스트리에서의 치료 효과 추정, 풀링된 CRISPRi 및 CasRx 실험을 해석해 전사체 특이적 효과와 인접 좌위 아티팩트를 구분하는 작업, cis 다변량 멘델 무작위화, 생식 보인자 위험 추정 등이 포함된다. 몇몇 경우 TXR1, TXR1i, LINC473, KIN1, PROTA, PROTB 같은 라벨은 실제 생물학적 표적이 아니라 합성 벤치마크 라벨로 명시적으로 설명된다.

OpenAI가 기존 벤치마크가 부족하다고 말하는 이유

OpenAI의 핵심 주장은 표준 생물학 벤치마크가 흔히 두 가지 방식 중 하나로 실패한다는 것이다. 한쪽에서는 역사적 실세계 데이터셋이 여러 개의 방어 가능한 접근법을 허용해, 모델이 추론이 약해서 실패했는지 아니면 벤치마크 제작자가 다른, 하지만 여전히 주관적인 경로를 선호했기 때문에 실패했는지 알기 어렵다. 다른 한쪽에서는 숫자적으로 관대한 문제들이 모델이 중요한 방법론적 오류가 있음에도 수용 가능한 답에 도달하게 만들 수 있다.

이를 해결하기 위해 OpenAI는 GeneBench-Pro 문제를 통제된 데이터 생성 과정으로 합성 구축했다고 말한다. 회사는 이를 통해 알려진 목표에 대한 결정론적 채점을 할 수 있고, 과제 난이도를 조정할 수 있으며, 그럴듯하지만 잘못된 분석은 실패해야 한다는 점을 확인하기 위한 절제 실험도 가능하다고 설명한다. OpenAI는 또한 지름길 경로와 정보 유출이 없는지 초안을 감사했다고 말한다.

이것은 벤치마크 개발에서 주목할 만한 설계 선택이다. 합성 구성을 사용하면 통제성과 채점의 명확성은 좋아질 수 있지만, 다른 위험도 생긴다. 벤치마크가 실제 연구 환경의 열린 복잡성보다 제작자의 가정과 선호를 더 반영할 수 있기 때문이다. OpenAI도 이 우려를 인지하고 있는 듯하며, 129개 문항 중 82개를 대학원생, 박사후연구원, 산업계 과학자, 교수 등 외부 검토자에게 보내 현실성, 식별 가능성, 방법론적 적절성을 평가하게 했다고 밝힌다.

그렇더라도 구매자와 연구자는 이용 가능한 증거가 주로 OpenAI 자체 자료에 기반한다는 점에 유의해야 한다. 벤치마크 설계는 엄격할 수 있지만, 실제 신약 발견이나 중개 워크플로에 얼마나 잘 부합하는지에 대한 공개적 근거는 아직 초기 단계다.

초기 결과는 진전은 보여주지만 신뢰성은 보여주지 않는다

OpenAI의 가장 강한 성능 주장은 자사 모델 GPT-5.6 Sol이 GeneBench-Pro에서 최고 추론 수준에서 28.7%의 통과율을 기록했고, “Pro mode”를 켰을 때는 31.5%까지 올랐다는 것이다. 회사는 원래의 GeneBench 작업이 시작됐을 때 GPT-5의 점수가 5% 미만이었다는 점과 대비시킨다.

OpenAI는 또한 테스트 시점 컴퓨트 확장이 상당히 중요했다고 말한다. 회사에 따르면, GPT-5.6 Sol은 가장 낮은 추론 수준에서 한 자릿수의 통과율에 그쳤지만, 가장 높은 추론 수준에서는 GPT-5.2보다 거의 6배 많은 문제를 해결하면서도 사용 토큰은 약 3분의 2 수준에 불과했다.

이러한 신호는 모델 개발자에게 흥미롭다. 성능 향상이 단지 기본 역량의 확장만이 아니라 추론 시점의 구성에서도 나오고 있음을 시사하기 때문이다. 실무적으로는 많은 AI 제품 팀이 이미 시험 중인 전략, 즉 일괄적인 추론 예산을 적용하기보다 고가치 분석 작업에 더 많은 컴퓨트와 더 긴 숙고 시간을 배정하는 전략을 지지한다.

하지만 결과는 현재의 한계도 분명히 보여준다. OpenAI의 벤치마크와 가장 강한 보고 설정을 사용하더라도 대략 10문제 중 7문제는 통과하지 못했다. OpenAI는 AI 에이전트가 여전히 인간 전문가를 대체할 만큼 신뢰할 수 없다고 인정한다. 회사는 또한 비용 비교를 덧붙여, 일반적인 문제 하나를 해결하는 데 인간 전문가가 20~40시간이 걸릴 것으로 검토자들이 추정한 반면 추론 비용은 문제당 몇 달러에 불과하다고 말한다. 그러나 이러한 경제적 주장은 배포 가능한 자율성의 증거라기보다 공급업체가 제시한 프레이밍으로 받아들여야 한다.

증거, 주장, 그리고 독립적으로 검증된 내용

이 이야기의 사실적 기반은 OpenAI의 발표와 사례 연구 자료다. 이 출처들은 몇 가지 구체적 사실을 뒷받침한다. GeneBench-Pro가 존재하며, 129개 문항으로 구성되고, 대표 문제 10개가 Hugging Face에 오픈소스로 공개될 예정이며, OpenAI가 제3자 벤치마킹을 위해 50문항 하위셋을 Artificial Analysis에 제공할 계획이라는 점이다.

같은 출처는 벤치마크의 범위가 유전체학, 정량 생물학, 중개 의학에 걸쳐 있으며, Python과 PLINK 2.0을 포함한 표준 바이오인포매틱스 환경을 포함한다는 점도 뒷받침한다.

그러나 벤치마크 점수, GPT-5와의 비교, 이 스타일의 과학적 추론에서 GPT 모델이 GLM 5.2 같은 선도적 오픈소스 모델보다 우수하다는 주장, 그리고 올해 말까지 벤치마크가 포화될 수 있다는 암시는 모두 OpenAI가 보고한 주장이다. 이는 유용하지만, 여기 제시된 자료만으로는 아직 독립적으로 재현되지 않았다.

OpenAI는 또 하나의 중요한 방법론적 주의사항도 공개한다. 개발 과정에서 프런티어 GPT 모델을 사용해 문제를 평가하고 강화했다는 점이다. 회사는 이것이 GeneBench-Pro를 다른 모델 계열에 비해 GPT 모델에 불리하게 편향시킬 수 있다고 의심했지만, 실제로는 경쟁 모델들이 출시 당시 해당 GPT 모델과 비슷하거나 더 낮은 성과를 보였다고 보고한다. 이러한 투명성은 유용하지만, 이 주장 역시 벤치마크 제작자에게서 나온 것이다. 구매자나 연구자가 신뢰할 수 있는 교차 모델 비교를 원한다면 Artificial Analysis를 통한 독립 테스트가 중요할 것이다.

이것이 AI 개발자와 생명과학 팀에 의미하는 것

AI 개발자에게 GeneBench-Pro는 평가 우선순위가 코딩과 교과서식 과학 질문을 넘어 이동하고 있다는 신호다. 생물정보학, 중개 의학, 내부 R&D 지원용 에이전트를 만들려는 팀이라면 이 벤치마크는 배포에서 중요한 실패 모드를 보여준다. 잘못된 추정 대상을 선택하는 일, 교란 구조를 잘못 읽는 일, 진단 후 계획을 갱신하지 못하는 일, 혹은 보기에는 정교하지만 의사결정에 안전하지 않은 답을 내놓는 일이 그것이다.

제약, 바이오테크, 보건 연구 분야의 기업 AI 팀에게는 메시지가 더 신중하다. GeneBench-Pro의 일부 과제를 통과할 수 있는 모델은 특히 추론 비용이 과학자 시간에 비해 낮을 때 분석 보조, 트리아지 도구, 가설 생성 어시스턴트로 유용할 수 있다. 하지만 OpenAI의 자체 결과는 고위험 워크플로에서 감독 없는 자율성을 뒷받침하지 않는다. 벤치마크가 잘 설계됐더라도 31.5%의 통과율은 신뢰할 만한 실행이 아니라 부분적 역량의 증거다.

그럼에도 이 벤치마크는 운영적으로 유용할 수 있다. 내부적으로 AI 에이전트를 평가하는 팀은 판단이 많이 필요한 작업에 대한 엄격한 테스트가 부족한 경우가 많다. GeneBench-Pro 같은 벤치마크는 일반적인 코딩 스위트나 객관식 생물학 시험보다 더 현실적인 기준선을 제공할 수 있으며, 특히 프롬프트 전략, 도구 사용, 라우팅 정책, 에스컬레이션 임계값을 비교할 때 그렇다.

경쟁 구도도 주목할 만하다. OpenAI는 GeneBench-Pro를 소프트웨어 작업에 강한 모델이 수치적 불확실성 하의 과학적 추론에도 자동으로 강한 것은 아니라는 증거로 제시한다. 이것이 제3자 평가에서 입증된다면, 생명과학 분야의 기업 AI를 위해 프런티어 폐쇄형 모델, 오픈 모델, 도메인 특화 시스템을 비교하는 방식이 바뀔 수 있다.

다음에 무엇을 지켜봐야 하나

가장 중요한 다음 신호는 Artificial Analysis의 독립적 벤치마킹이다. 그 50문항 하위셋이 공개되고 여러 모델 계열에 걸쳐 실행되면, 시장은 OpenAI의 내부 순위인 GPT-5.6 Sol, GPT-5.5, GLM 5.2가 실제로 유지되는지 더 명확히 볼 수 있을 것이다.

둘째, GeneBench-Pro의 재사용성이 실제로 어느 정도인지 지켜볼 필요가 있다. OpenAI는 10문항을 Hugging Face에 오픈소스로 공개한다고 말하지만, 외부 연구실과 제품 팀이 그 과제들을 평가 파이프라인에 넣을 만큼 현실적이라고 느끼는지에 따라 더 넓은 채택이 결정될 것이다.

셋째, 공급업체들이 이 스타일의 벤치마크에 맞춰 최적화하기 시작하는지 추적할 가치가 있다. OpenAI가 시사하듯 점수가 빠르게 향상된다면, 핵심 질문은 모델이 널리 전이 가능한 과학적 판단을 배우고 있는지, 아니면 단지 특정 벤치마크 가족에 적응하고 있는지가 될 것이다.

마지막으로 제품화 여부를 주시해야 한다. OpenAI나 다른 회사가 생의학 분석용 에이전트 제품에 GeneBench-Pro 스타일의 추론을 연결하기 시작한다면, 구매 팀은 통과율뿐 아니라 보정(calibration), 재현성, 감사 추적, 안전한 인간 인계에 대한 증거도 원할 것이다.

Creati.ai 관점

GeneBench-Pro는 단순한 또 하나의 리더보드 공개가 아니다. 그것은 AI에 대해 더 어려운 질문을 형식화하려는 시도다. 워크플로가 충분히 명세되지 않고 데이터가 잡음이 많을 때, 모델이 방어 가능한 선택을 내릴 수 있는가? 이것은 생물학 상식 퀴즈를 맞히거나 코드 조각을 생성하는 것보다 응용 연구의 실제 도전에 훨씬 가깝다.

문제는 벤치마크의 진전을 배포 준비 상태와 혼동해서는 안 된다는 점이다. OpenAI의 자체 수치는 특히 GPT-5.6 Sol에서 의미 있는 개선을 보여주지만, 동시에 모델이 컴퓨테이셔널 생물학에서 신뢰할 만한 자율성에 얼마나 먼지도 보여준다. 창업자와 제품 팀에게 실질적인 교훈은 부분적 역량을 전제로 설계하는 것이다. AI 에이전트는 탐색 공간을 줄이고, 분석을 제안하고, 반복 작업의 부담을 덜어주는 데 사용하되, 결과가 큰 해석은 인간이 책임지도록 유지해야 한다. Artificial Analysis와 외부 연구자들이 이 벤치마크의 유용성을 검증한다면, GeneBench-Pro는 그 중간 지대를 위한 의미 있는 테스트가 될 수 있다.

추천

OpenAI, 지저분하고 판단이 많이 필요한 생물학 연구를 AI가 감당할 수 있는지 테스트하는 GeneBench-Pro 출시

OpenAI가 생물학 워크플로에서 AI 에이전트가 연구 수준의 판단을 내릴 수 있는지 측정하는 유전체 벤치마크 GeneBench-Pro를 공개했다.