LLM은 불가능한 작업임을 인지하면서도 숫자와 절차에 현혹되어 그대로 실행해 버리곤 합니다. “세차를 해야 하는데, 세차장이 50m 떨어져 있습니다. 걸어가야 할까요, 차를 몰고 가야 할까요?” 많은 모델이 '50m'라는 숫자에 집착해 경로를 최적화한 뒤 걸어가라고 추천합니다. 세차장에 가야 하는 건 차 자체라는 사실을 잊은 채 말이죠. 연구진은 이 결함을 활용해 SaliTrap을 구축했습니다. 숫자 교란 요소로 위장한 1,145개의 불가능한 과제를 12개의 주요 LLM에서 테스트했습니다. 가장 뛰어난 모델조차 함정을 회피한 비율은 54.8%에 불과했습니다. 더 충격적인 것은, 함정을 명확히 감지한 후에도 GLM-5.1과 Kimi-K2가 각각 86.2%와 81.8%의 확률로 지시를 그대로 따랐다는 점입니다. AI agent에게 불가능한 전제를 인지하는 것만으로는 부족합니다. 시스템이 워크플로우를 스스로 중단할 수 있어야 합니다. #AI #LLM #AIAgents
Claude를 아예 하나의 회사로 만들어버렸습니다 실제 조직도처럼 구조화된 42개 스킬 - 모든 부서가 실질적인 기능을 수행합니다 개발자: - Superpowers - Context7 - Skill Creator - MCP Builder - Webapp Testing - Claude-Mem 디자이너: - UI UX Pro Max - Taste - Frontend Design -Transitions - Web Artifacts - Brand Guidelines 마케팅 - 카피라이팅, SEO, 리드 마그넷, 캠페인을 위한 45개 스킬 소셜 미디어 - 포스트, 릴스, 썸네일, 콘텐츠 워크플로우를 위한 17개 스킬 재무 - 재무제표, 계정 조정, 감사를 위한 8개 스킬 스몰 비즈니스 - 현금 흐름, 급여, 인보이스, 운영을 위한 31개 스킬 법무 - 계약서, NDA, 컴플라이언스를 위한 9개 스킬 이건 프롬프트도 아니고, 래퍼(wrapper)도 아닙니다. Claude를 위한 완전한 운영체제입니다 - 모든 부서가 실제 채용된 직원처럼 동작합니다 추가할 만한 다른 스킬 repo가 있다면 공유해 주세요. v2 리스트를 만들어 보겠습니다
구글은 단순히 AI 레이스에서 이기려는 게 아닙니다. AI 에이전트 생태계 전체를 장악하려는 것입니다. 모두가 ChatGPT vs Claude를 두고 논쟁하는 동안, 구글은 조용히 판을 구축해 왔습니다: 모델 → Gemini Pro, Flash, Deep Think, Gemma 디자인 → Stitch, Whisk, Imagen 리서치 → NotebookLM, AI Mode 비디오 → Veo, Flow, Google Vids 코딩 → Antigravity IDE, Gemini CLI, Jules 에이전트 → A2A, ADK, FileSearch API 진짜 무서운 점은요? 이 모든 툴들이 서로 연동되어 작동한다는 겁니다. 즉: 10배 더 빠른 프로토타이핑 엔드투엔드 AI 워크플로우 GCP 기반 프로덕션 레디 에이전트 다음 AI 전쟁은 모델 vs 모델의 싸움이 아닐 겁니다. 생태계 vs 생태계의 싸움이 될 것입니다. 이 스택을 여기에 정리해 두었습니다:
