알레프 알파, 78B 오픈소스 MoE 모델 '콜리브리' 공개… 3B 활성 파라미터로 최대 100만 토큰 문맥 지원

Key Points
- 1총 78B 파라미터 중 토큰당 3B(384개 중 6개 전문가)만 활성화하는 MoE 구조와 슬라이딩 윈도우 어텐션으로 서빙 비용 대비 성능을 파레토 최적화했습니다.
- 224조 토큰 규모의 대규모 사전·사후 학습을 거쳐 기본 16k부터 최대 100만(1M) 토큰에 이르는 초장문 컨텍스트 윈도우를 안정적으로 지원합니다.
- 3자체 개발한 머린-아서(Merlin-Arthur) 프로토콜을 통해 정보가 부족할 때 답변을 유보(Abstention)하도록 훈련하여 환각 발생률을 대폭 낮췄습니다.
- 4독일어와 영어 형태소를 정교하게 보존하는 UniBPE 토크나이저를 채택해 토큰 압축률을 극대화하고 추론 지연 시간을 크게 줄였습니다.
- 5가중치 전량이 아파치 2.0 라이선스로 허깅페이스에 공개되었으며 vLLM 플러그인을 통해 엔터프라이즈 온프레미스 환경에 즉시 서빙할 수 있습니다.
독일 인공지능(AI) 기업 알레프 알파(Aleph Alpha)가 유럽의 데이터 주권과 고신뢰 산업 현장을 겨냥한 차세대 오픈소스 언어 모델 '콜리브리(Kolibri)'를 전격 출시했다. 독일 통일의 날에 맞춰 공개된 콜리브리는 총 780억 개(78B) 파라미터 중 토큰당 30억 개(3B)만을 사용하는 MoE(Mixture-of-Experts) 구조로 설계되었으며, 최대 100만(1M) 토큰의 초장문 컨텍스트 윈도우를 지원한다. 알레프 알파는 전체 가중치를 아파치(Apache) 2.0 라이선스로 허깅페이스에 공개하여, 규제가 엄격한 공공 행정, 항공우주, 제조 등 엔터프라이즈 환경에서 내부 데이터를 외부로 전송하지 않고 온프레미스로 배포할 수 있도록 지원한다.
콜리브리는 모델 성능과 서빙 비용 간의 파레토 프론티어(Pareto Frontier) 달성에 초점을 맞췄다. 소수의 거대 전문가 대신 384개의 세부 전문가(Expert) 중 6개를 활성화하는 고희소성 구조를 채택했으며, 50개 레이어 중 10개에만 전체 어텐션을 적용하고 나머지 40개에는 512 토큰 슬라이딩 윈도우 어텐션을 구성해 디코딩 연산 및 메모리 점유율을 획기적으로 낮췄다. 알레프 알파의 실측 벤치마크에 따르면 123B 밀집(Dense) 모델이 H100 2장에서 256k 컨텍스트 기준 동시 요청을 3개만 처리할 수 있었던 반면, 콜리브리는 18개의 동시 요청을 수용하면서도 디코딩 속도가 28% 빨라 대규모 트래픽 처리에 최적화된 성능을 입증했다.
학습 인프라 측면에서는 엔비디아 B200 GPU 768장과 묜(Muon) 옵티마이저를 활용해 21일 동안 20조(20T) 토큰의 사전 학습(16k 컨텍스트)을 손실 급증(Loss Spike) 없이 완수했다. 이후 64k 컨텍스트 미드 트레이닝(3.44T 토큰)과 256k 롱 컨텍스트 적응(2,000억 토큰)을 거쳐 총 24조 토큰에 달하는 고품질 데이터셋을 학습했다. 특히 전문가 라우팅을 위해 배치 크기와 무관하게 고정 통신 비용으로 완벽한 부하 분산을 달성하는 '정확한 분위수 밸런싱(Exact Quantile Balancing)' 기법을 도입하여 모델 품질과 학습 효율을 동시에 끌어올렸다.
환각(Hallucination) 방지와 사실 기반 추론(Grounding) 또한 핵심 차별점이다. 알레프 알파는 주어진 컨텍스트에 답변 근거가 없을 때 억지 추측 대신 '모른다'고 응답하도록 유도하는 자체 '머린-아서(Merlin-Arthur)' 프로토콜을 훈련에 적용했다. 그 결과 AA-Omniscience 비환각 평가에서 44.0%, RGB 벤치마크의 답변 유보 항목에서 85.6%를 기록하며 경쟁 오픈소스 모델들을 크게 상회했다. 사후 학습(Post-training) 단계에서는 120만 개 이상의 환경 기반 대규모 강화학습(RL)을 진행했으며, 추론 노력 수준을 4단계(None, Low, Medium, High)로 제어할 수 있는 기능을 탑재해 작업 난이도에 맞춰 지연 시간과 비용을 동적으로 조절할 수 있도록 설계했다.
콜리브리는 허깅페이스(Aleph-Alpha/Kolibri-1)를 통해 즉시 다운로드할 수 있으며, vLLM 기반 전용 서빙 패키지인 'aleph-alpha-inference'를 통해 배포할 수 있다. FP8 KV 캐시와 전용 추론 파서를 적용해 도구 호출 및 추론 모드를 활성화할 수 있으며, 262k를 초과하는 초장문 컨텍스트 서빙 시에는 max-model-len 및 Hugging Face 오버라이드 설정을 1,048,576으로 지정하여 운영할 수 있다.
마이크로소프트, 초저지연 실시간 음성인식 모델 'MAI-Transcribe-2-Streaming' 및 차세대 음성 합성 라인업 공개
마이크로소프트 AI가 아티피셜 아날리시스 벤치마크 1위를 기록한 실시간 스트리밍 음성인식 모델 'MAI-Transcribe-2-Streaming'과 차세대 음성 합성 모델 'MAI-Voice-2.1', 'MAI-Voice-2.1-Flash'를 전격 공개했습니다. 신규 음성인식 모델은 오디오 유입 후 100ms 만에 부분 전사를 생성하여 발화 도중에도 실시간 추론과 도구 호출을 수행할 수 있도록 지원합니다. 또한 150ms 초저지연 생성과 단일 화자 정체성을 유지하는 다국어 음성 합성 모델을 결합해 자연스러운 양방향 보이스 에이전트 구축 환경을 제공합니다.
메타(Meta), 'Muse AI' 에이전트 탑재 커스텀 기기 제작용 오픈소스 코드 공개
메타가 사용자가 자체 하드웨어에 자사의 Muse AI 에이전트를 연동할 수 있도록 가젯 SDK를 오픈소스로 공개했습니다. 개발자는 라즈베리 파이나 ESP32 보드를 활용해 디스플레이와 센서를 제어하는 DIY AI 기기를 구축할 수 있습니다.
스트랜즈, 텍스트 생성 배제한 2B 오픈소스 의사결정 모델 'Strands Decider 2B' 공개… 100ms대 초고속 에이전트 라우팅 지원
스트랜즈(Strands)가 복잡한 텍스트 생성 대신 객관식 선택과 신뢰도 점수 산출에 특화된 20억 파라미터 규모의 오픈소스 모델 '스트랜즈 디사이더 2B(Strands Decider 2B)'를 공개했습니다. Qwen3.5-2B 토르소에 경량 포인터 헤드를 결합하여 로컬 하드웨어 환경에서도 중앙값 115ms 수준의 초저지연으로 결정을 내릴 수 있도록 설계되었습니다. 에이전트의 도구 선택, 모델 라우팅, 가드레일 등 빠른 시스템 1(System 1) 판단이 필요한 워크플로우의 비용과 지연 시간을 대폭 절감할 수 있습니다.
