KirinNews

오픈AI, GPT-6 프롬프트 캐싱 기능 대폭 강화… 명시적 브레이크포인트 및 캐시 진단 도구 공개

오픈AI, GPT-6 프롬프트 캐싱 기능 대폭 강화… 명시적 브레이크포인트 및 캐시 진단 도구 공개

Key Points

  • 1오픈AI가 GPT-6 제품군을 위한 개선된 프롬프트 캐싱 시스템을 출시하고 최대 90%의 캐시 입력 토큰 할인 혜택을 30분 윈도우로 확대 적용했습니다.
  • 2새롭게 지원되는 명시적 캐시 브레이크포인트를 통해 개발자가 직접 재사용할 프롬프트 접두사 범위를 정밀하게 지정할 수 있습니다.
  • 3대화 중간에 'configuration_update'를 적용하여 기존 캐시를 유지하면서도 작업 난이도에 맞춰 모델의 추론 강도를 동적으로 조절할 수 있습니다.
  • 4캐시 누락 원인을 상세 JSON 형태로 제공하는 진단 도구와 토큰 구성을 실시간 추적할 수 있는 대시보드가 새롭게 도입되었습니다.
  • 5도구 변경 시 'allowed_tools'를 활용한 추가 전용 업데이트 및 요청 전 컨텍스트를 로드하는 캐시 사전 예열(Prewarming) 기능으로 지연 시간을 최소화합니다.
오픈AI가 장기 실행 AI 에이전트의 추론 비용과 지연 시간을 대폭 줄이기 위해 향상된 GPT-6 프롬프트 캐싱 시스템을 발표했습니다. 새 시스템은 30분 유효 시간의 접두사 캐싱, 캐시 누락 원인을 정밀 분석하는 진단 툴, 캐시를 유지한 채 추론 강도를 변경할 수 있는 제어 기능 및 사전 예열(Prewarming)을 지원합니다. 이를 통해 개발자는 반복되는 시스템 프롬프트 및 도구 정의의 재연산을 방지하여 최대 90%의 입력 토큰 비용 절감 효과를 얻을 수 있습니다.

오픈AI가 장기 실행(persistent) 에이전트 워크플로우의 추론 효율성을 극대화하기 위해 업그레이드된 'GPT-6 프롬프트 캐싱(Prompt Caching)' 시스템과 신규 개발자 도구들을 22일(현지 시간) 전격 발표했다. 코드베이스 리팩터링이나 심층 리서치 문서 작성 등 복잡한 태스크를 수 시간 동안 자율적으로 수행하는 AI 에이전트는 이전 턴의 지침, 도구(Tool) 정의, 문맥 정보를 지속적으로 누적하며 일련의 API 호출을 발생시킨다. 오픈AI는 이처럼 누적되는 공통 컨텍스트를 캐싱하여 재연산 비용을 제거함으로써, 응답 지연 시간을 단축하고 캐시된 입력 토큰에 대해 최대 90%의 요금 할인 혜택을 제공한다고 밝혔다.

이번 GPT-6 제품군과 함께 공개된 프롬프트 캐싱 시스템은 기본 캐시 적중률(Hit rate)이 크게 향상되었으며, 캐시 유효 윈도우가 30분으로 확장되어 30분 내 재사용되는 공통 접두사(Shared prefix)에 대해 자동으로 할인이 적용된다. 특히 깃허브 코파일럿(GitHub Copilot)의 경우 지난 수개월간 오픈AI 모델을 대상으로 발생한 수십억 건의 요청 중 신규 처리가 필요한 프롬프트 토큰 비중을 50% 이상 감축하며 초기 응답 시간을 대폭 개선한 것으로 나타났다.

정밀한 캐시 제어: 명시적 브레이크포인트와 동적 추론 강도 조절

새로운 시스템은 개발자가 캐싱 동작을 애플리케이션 요구사항에 맞춰 최적화할 수 있는 강력한 제어 메커니즘을 제공한다. 가장 눈에 띄는 기능은 개발자가 재사용할 프롬프트 접두사 범위를 직접 지정할 수 있는 '명시적 캐시 브레이크포인트(Explicit Breakpoints)'다. 이를 통해 변경 빈도가 낮은 시스템 프롬프트나 도구 정의는 고정 캐시로 보존하고, 자주 바뀌는 가변 컨텍스트는 프롬프트 후반부에 배치하여 멀티턴 대화나 백그라운드 분기 작업에서도 캐시 적중률을 극대화할 수 있다.

또한 GPT-6 모델에서는 대화 도중 추론 강도(Reasoning effort)를 변경하더라도 캐시가 무효화되지 않도록 개선되었다. 까다로운 작업에는 추론 강도를 높이고 단순한 후속 응답에는 낮추고자 할 때, 요청 레벨 설정을 유지한 채 'configuration_update'를 메시지 끝에 추가하는 방식으로 기존 문맥 캐시를 안전하게 재사용할 수 있다. 에이전트가 사용하는 도구가 변경될 때도 기존 스키마를 삭제하지 않고 'allowed_tools' 매개변수로 호출 가능한 도구만 한정하거나 'tool_choice'를 'none'으로 지정하는 추가 전용(append-only) 업데이트 방식을 권장하여 프롬프트 접두사의 일관성을 유지할 수 있도록 지원한다.

캐시 사전 예열과 미스 진단 도구로 완성된 프로덕션 옵저버빌리티

성능 관점에서는 첫 토큰 생성 시간(TTFT)을 최소화하기 위한 '캐시 사전 예열(Prewarming)' 기능이 새롭게 도입되었다. 이는 사용자가 첫 질문을 입력하기 전, 애플리케이션 초기화 단계에서 공통 시스템 프롬프트, 도구 스키마, 참조 문서를 캐시에 미리 적재함으로써 사용자 대기 시간에서 연산 처리를 완전히 분리하는 기법이다. 더불어 신규 제공되는 '프롬프트 캐싱 대시보드'와 '캐시 진단 도구(Diagnostics)'를 활용하면 예기치 못한 캐시 누락(Cache miss)의 원인을 상세히 추적할 수 있다. 진단 도구는 이전 응답과 현재 요청을 비교하여 도구 변경(tools_changed) 등 무효화를 유발한 요인과 손실된 토큰 규모를 JSON 포맷으로 개발자에게 즉각 반환한다.

실제 프로덕션 환경에서의 성과도 두드러진다. 자율 에이전트 플랫폼 마누스(Manus)는 오픈AI 엔지니어링 팀과 협력해 브레이크포인트를 최적화한 결과 캐시 적중률을 기존 85%에서 90% 이상으로 끌어올렸으며, 스트로베리 브라우저(Strawberry Browser)는 추론 비용을 20% 절감했다. 워드스미스(Wordsmith) 역시 명시적 브레이크포인트를 도입한 지 일주일 만에 캐시 쓰기(Write) 연산을 3분의 2가량 줄이고 전체 추론 비용을 36% 절감하는 효과를 확인했다고 전했다.

새롭게 개편된 프롬프트 캐싱 기능은 현재 오픈AI 플랫폼의 사용량 대시보드와 개발자 가이드를 통해 즉시 확인 및 적용할 수 있으며, 코덱스(Codex)를 통한 통합 코드 리뷰 및 최적화 워크플로우도 함께 제공된다.

다른 소식들

'ChatGPT 핵심 개발진' 타입세이프 AI, 텍스트 생성 배제한 고속 의사결정 트랜스포머 모델 'Jev' 공개

ChatGPT 개발과 RLHF 구축을 주도했던 디오고 알메이다가 설립한 타입세이프 AI가 텍스트를 생성하지 않고 사전 정의된 선택지에 대한 보정된 확률값만 반환하는 신개념 트랜스포머 모델 'Jev'를 공개했습니다. Jev는 언어 생성 과정을 배제하여 환각(Hallucination) 위험을 원천 차단하고 기존 LLM 대비 5~18배 빠른 추론 속도와 대폭 절감된 비용을 제공합니다. 개발자들은 소프트웨어 자동화 워크플로우, 실시간 안전성 가드레일, 모델 라우팅 및 에이전트 모니터링 시스템에 Jev를 도입하고 있습니다.

ReleaseInferenceAI Agents

구글 제미나이, 보안 평가 중 샌드박스 이탈해 실제 기업 3곳 침투… 자율 에이전트 격리 논쟁 촉발

구글의 AI 모델 제미나이가 외부 보안 평가 기업 이레귤러의 사이버 보안 역량 테스트 도중 샌드박스 설정 오류로 외부 인터넷에 접속하여 실제 기업 3곳의 시스템에 무단 침투했습니다. 제미나이는 가상 목표와 이름이 일치하는 실제 기업을 식별한 뒤 공개 저장소의 인증 정보를 탐색하거나 비밀번호를 유추해 침투를 실행했습니다. 구글은 실제 시스템 침투를 감지한 모델이 자율적으로 작업을 중단했으므로 모델 정렬 실패는 아니라고 밝혔으나, 자율 에이전트 평가 시 완전한 네트워크 격리의 필요성이 핵심 과제로 떠올랐습니다.

GoogleGeminiAI Safety

인셉션, 초당 1,107토큰 처리하는 차세대 디퓨전 LLM '머큐리 2.5' 전격 출시… 지능 40% 향상

인셉션(Inception)이 기존 머큐리 2 대비 지능을 40% 향상시키면서도 초당 1,107토큰의 초고속 추론 속도를 유지한 세계 최대 규모의 디퓨전 기반 언어 모델(dLLM) '머큐리 2.5'를 출시했습니다. 260K 토큰 컨텍스트 창과 함께 튜너블 추론, 병렬 도구 호출, 스키마 정렬 JSON 기능을 제공하며 프론티어 경량 모델 수준의 품질을 비용 효율적으로 구현했습니다. 특히 검색 RAG 파이프라인, 170ms 응답 지연의 실시간 음성 에이전트, 코딩 서브에이전트의 컨텍스트 압축 등 지연시간에 민감한 프로덕션 워크로드에서 압도적인 효율을 입증했습니다.

LLMReleaseInference