AI가 과학 연구에 관여하는 방식이 바뀌고 있다. 논문을 검색하고 요약해주는 보조 도구 수준을 넘어, 가설을 스스로 세우고 실험을 설계·수행하고 그 결과를 검증하는 단계까지 AI가 참여하는 'Scientific AI' 경쟁이 국내외에서 동시에 벌어지고 있다. 국내에서는 아스테로모프가, 해외에서는 오픈AI·앤트로픽·라일라 사이언스·피리오딕 랩스·디스커버리 루프 등이 각자의 방식으로 이 흐름을 이끌고 있다.
수학은 형식 검증, 생물·소재는 실제 실험
이 경쟁의 갈래는 크게 둘로 나뉜다. 수학처럼 형식적으로 검증 가능한 분야에서는 AI가 내놓은 해법을 코드나 논리 체계로 재확인하는 방식이 쓰인다. 오픈AI는 내부 연구 모델을 통해 나비에-스토크스 밀레니엄 문제 해법을 제안하는 과정에 약 1만개의 에이전트를 동시 투입해 약 88시간 만에 해법에 도달했고, 이후 GPT-6 Astra 모델로 17시간을 더 들여 이를 형식화·검증했다. 앤트로픽은 클로드를 활용해 페르마 마지막 정리 증명을 형식화하는 데 11일을 들였고, 그 결과 약 1300만줄 규모의 Lean 코드를 만들어냈다.
반면 생물학이나 신소재 분야는 형식 검증만으로는 가설을 확인할 수 없다. 실제 실험을 거쳐야 검증이 성립하는 구조이기 때문에, AI의 추론 능력을 실험 환경과 어떻게 연결하느냐가 관건으로 떠오르고 있다. 이 지점에서 경쟁의 축이 AI 모델 자체의 성능에서 실제 실험 데이터·장비·도구와의 연결력으로 옮겨가는 모습이다.
국내에서는 추론 레이어, 해외에서는 자율실험실
아스테로모프는 범용 AI 모델과 실제 과학 연구를 잇는 '추론 레이어'를 개발하는 국내 기업이다. LLM에 분야별 과학 데이터와 전문 도구, 다수 AI 에이전트의 협업·검증 과정을 결합해 반복 추론으로 가설을 발전시키는 구조다. 이 회사의 개념검증(PoC) 시스템인 틸라(Thyla) 1.0은 모델 애그노스틱 구조로 설계됐으며, 기반 모델인 GLM-5.1의 Frontier Science-Research 점수가 10.0%였던 것을 33.9%까지 끌어올렸다. 지난 7월 열린 제56회 국제물리올림피아드(IPhO 2026) 이론시험에서는 30점 만점에 28.6점을 받았는데, 이 시험은 5시간 동안 진행됐다.

해외에서는 자율실험실과 AI를 결합한 폐쇄루프 방식이 두드러진다. 라일라 사이언스는 AI 모델과 로봇 기반 자율실험실을 결합한 'AI Science Factory'를 구축하고 있으며, 95만개 이상의 mRNA 서열을 합성한 것으로 나타났다. 피리오딕 랩스는 AI와 자율실험실을 결합해 초전도체·자성 소재 등 신물질을 탐색하는 회사로, 지난 15일 1조 파라미터 규모의 모델 Periodic Neon을 공개했다. 연구·엔지니어링 과정 자체를 AI로 자동화하는 데 초점을 맞춘 디스커버리 루프도 이 흐름에 함께 놓인다.
경쟁의 무게추, 벤치마크에서 실험 연결력으로
아스테로모프 관계자는 “향후 과학 AI의 경쟁력은 단순히 벤치마크에서 높은 점수를 내는 것을 넘어 실제 연구 현장에서 의미 있는 가설을 제시하고 이를 실험을 통해 검증하는 과정까지 얼마나 효과적으로 이어갈 수 있느냐에 달려 있다”고 말했다. 이는 국내외에서 동시에 벌어지고 있는 이 경쟁이 결국 어떤 기준으로 승부가 갈릴지를 보여주는 대목이다.
이 관계자는 “AI의 추론과 실제 실험을 긴밀하게 연결해 복잡한 과학 연구를 반복 가능한 체계로 만드는 데 집중하겠다”고 덧붙였다. 수학 분야의 형식 검증 경쟁과 생물학·신소재 분야의 실험 연결 경쟁이 동시에 진행되는 가운데, Scientific AI라는 새로운 영역에서 국내외 기업들이 각자의 접근법으로 자리를 다지고 있는 셈이다.