KirinNews

인셉션, 초당 1,107토큰 처리하는 차세대 디퓨전 LLM '머큐리 2.5' 전격 출시… 지능 40% 향상

인셉션, 초당 1,107토큰 처리하는 차세대 디퓨전 LLM '머큐리 2.5' 전격 출시… 지능 40% 향상

Key Points

  • 1인셉션이 이전 버전 대비 지능을 40% 개선하고 260K 컨텍스트를 지원하는 사상 최대 규모의 디퓨전 언어 모델(dLLM) '머큐리 2.5'를 공식 출시했습니다.
  • 2엔비디아 GPU 환경에서 초당 1,107토큰의 초고속 추론 속도를 발휘하며 튜너블 추론, 병렬 도구 호출, 스키마 정렬 JSON 출력을 기본 제공합니다.
  • 3표준 API 요금은 입력 100만 토큰당 0.20달러, 출력 0.75달러이며 출시 프로모션을 통해 최대 80% 할인된 가격으로 제공됩니다.
  • 4오픈콜의 음성 에이전트 P50 지연시간을 0.2초 미만으로 단축하고 어그먼트 코드의 컨텍스트 압축 지연을 82% 줄이는 등 프로덕션 환경에서 실증적인 효율을 입증했습니다.
  • 5첫 토큰 생성 시간 170ms 미만의 '머큐리 보이스'와 dLLM 기반 프롬프트 라우팅 솔루션 '머큐리 라우터'의 프리뷰도 함께 공개되었습니다.
인셉션(Inception)이 기존 머큐리 2 대비 지능을 40% 향상시키면서도 초당 1,107토큰의 초고속 추론 속도를 유지한 세계 최대 규모의 디퓨전 기반 언어 모델(dLLM) '머큐리 2.5'를 출시했습니다. 260K 토큰 컨텍스트 창과 함께 튜너블 추론, 병렬 도구 호출, 스키마 정렬 JSON 기능을 제공하며 프론티어 경량 모델 수준의 품질을 비용 효율적으로 구현했습니다. 특히 검색 RAG 파이프라인, 170ms 응답 지연의 실시간 음성 에이전트, 코딩 서브에이전트의 컨텍스트 압축 등 지연시간에 민감한 프로덕션 워크로드에서 압도적인 효율을 입증했습니다.

AI 인프라 및 디퓨전 모델 전문 기업 인셉션(Inception)이 자사의 최신 플래그십 프로덕션 모델인 '머큐리 2.5(Mercury 2.5)'를 공식 출시했다. 머큐리 2.5는 현재까지 훈련된 디퓨전 기반 언어 모델(Diffusion LLM, dLLM) 중 사상 최대 규모의 모델로, 기존 머큐리 2 대비 지능을 40% 끌어올리면서도 초당 1,107토큰이라는 경이적인 추론 처리량을 동일하게 유지한 것이 핵심이다. 특히 실제 엔터프라이즈 프로덕션 환경의 피드백과 실패 사례를 수집해 모델 평가 및 훈련 루프를 정교화함으로써, GPT-5.6 루나(Luna Low), 제미나이 3.5 플래시-라이트(Gemini 3.5 Flash-Lite), 클로드 하이쿠 4.5(Claude Haiku 4.5) 등 주요 프론티어 연구진의 비용 최적화 모델들과 대등한 품질을 확보했다.

이번 릴리스는 오토리그레시브(Autoregressive) 방식이 주류인 언어 모델 생태계에서 디퓨전 아키텍처의 엔지니어링 실용성을 완벽하게 증명해냈다. 머큐리 2.5는 260K 토큰에 달하는 긴 컨텍스트 창을 지원하며, 튜너블 추론(Tunable Reasoning), 병렬 도구 호출(Parallel Tool Calls), 엄격한 스키마 정렬 JSON(Schema-aligned JSON) 출력 등 최신 에이전트 시스템에 필수적인 핵심 기능을 포괄한다. 모델 서빙 비용은 입력 100만 토큰당 0.20달러, 출력 100만 토큰당 0.75달러로 책정되었으며, 출시 기념 프로모션을 통해 입력 0.04달러, 출력 0.15달러의 할인된 가격으로 제공된다. 엔비디아 가속 컴퓨팅 그룹 측은 머큐리 2.5가 범용 엔비디아 GPU 인프라에서 새로운 아키텍처가 얼마나 신속하게 프로덕션 레디 시스템으로 안착할 수 있는지를 보여주는 대표 사례라고 평가했다.

실제 프로덕션 워크로드에서 입증된 지연시간 혁신

인셉션에 따르면 머큐리 시리즈는 수천 명의 개발자와 수십 개 엔터프라이즈 기업의 프로덕션에 도입되어 사용량이 전작 대비 10배 이상 급증했다. 검색 에이전트 및 RAG 파이프라인의 경우 단일 사용자 요청에도 검색 계획, 쿼리 재작성, 결과 재순위화, 팩트 구조화, 요약, 검증 등 수십 번의 모델 호출이 연쇄적으로 발생하는데, 머큐리는 단일 사용자 인터랙션 시간 내에 모든 호출을 완결할 수 있는 극도의 저지연 성능을 제공한다.

실시간 음성 에이전트 분야에서도 두각을 나타내고 있다. 실시간 AI 전화 통화 에이전트를 구축하는 오픈콜(OpenCall)의 프로덕션 도입 사례에 따르면, 머큐리 전환 이후 모델 응답 지연의 중앙값(P50)이 기존 0.4초에서 0.2초 미만(약 170ms)으로 대폭 단축되었고, 99번째 백분위수(P99) 응답 시간은 수 분 단위에서 단 1초로 줄어들었다. 또한 코딩 보조 도구 어그먼트 코드(Augment Code)는 컨텍스트 압축(Context Compaction)과 MCP 도구 검색에 머큐리를 적용해 세션 압축 대기 시간을 약 150초에서 27초로 82% 줄였으며, 퀄리티 저하 없이 서빙 비용을 90% 절감했다고 밝혔다.

머큐리 보이스 및 라우터 프리뷰, 차세대 모델 로드맵

인셉션은 머큐리 2.5 출시와 함께 '머큐리 보이스(Mercury Voice)'와 '머큐리 라우터(Mercury Router)'의 프리뷰도 함께 공개했다. 머큐리 보이스는 첫 토큰 생성 시간(TTFT)을 170ms 이하로 줄여 지연에 가장 민감한 음성 에이전트에 특화된 dLLM이며, 머큐리 라우터는 dLLM을 통해 유입되는 프롬프트를 실시간 분석하여 품질, 속도, 비용의 최적 균형을 가진 모델로 트래픽을 자동 라우팅한다.

현재 머큐리 2.5는 인셉션 공식 API 플랫폼, 베이스텐(Baseten), 오픈라우터(OpenRouter)를 통해 즉시 사용할 수 있으며, 엔터프라이즈 고객을 위한 전용 용량, 오토스케일링, 규제 준수 제어, 데이터 보존 설정도 지원된다. 무료 웹 채팅 및 1억 개의 무료 토큰이 포함된 개발자 API가 개방되었으며, Y 콤비네이터 선정 기업에는 50만 달러 규모의 배포 혜택이 제공된다. 인셉션 연구진은 이미 디퓨전의 처리량과 토큰 효율성을 유지한 채 지능을 한 단계 더 끌어올릴 차세대 대형 모델 학습에 착수했으며 향후 수개월 내 공개할 예정이다.

다른 소식들

OpenAI, 3천억 토큰 쏟아부어 수학 난제 증명… 학계는 '데이터 무단 도용' 반발

NYU 수학자 트리스탄 벅마스터가 AI를 활용해 밀레니엄 수학 난제인 나비에-스토크스 방정식 증명에 다가선 가운데, OpenAI가 이를 가로채듯 자체 증명을 발표해 논란이 일고 있습니다. OpenAI는 미공개 차세대 모델을 사용해 3천억 토큰(약 2,250만 달러 규모)을 소모하며 일주일 만에 증명을 완료했다고 밝혔으나, 학계에서는 기존 연구 데이터가 모델 학습에 무단 사용되었을 가능성을 제기하고 있습니다. 이번 사태는 AI의 수학적 추론 능력이 비약적으로 발전했음을 보여주는 동시에, 프롬프트 데이터의 무단 학습과 AI 기업의 연구 윤리 문제를 수면 위로 끌어올렸습니다.

OpenAIModels & ResearchMathematics