Opus 5.5, 싸졌지만 옮기려면 코드부터 고쳐야 한다
Opus 5.5의 가격 인하는 진짜지만, 벤더가 말한 40% 절감은 캐시와 낮아진 기본 설정을 전제로 한 계산이고 기존 코드는 네 군데서 깨진다.
한눈에
- Anthropic이 Claude Opus 5.5를 냈다. 정가는 입력·출력 모두 20% 내렸고, 캐시 읽기는 60% 내렸다. '전형적 작업에서 40% 절감'은 Anthropic 자체 계산이다.
- 생각 끄기, 특정 도구 강제 호출, 구형 컴퓨터 사용 도구가 이제 400 오류를 낸다. 모델 ID만 바꾸면 되는 업그레이드가 아니다.
- 기본 effort가 high에서 medium으로 내려갔다. 같은 코드가 더 싸게 돌지만 그만큼 덜 생각할 수 있어, 품질 재측정이 먼저다.
프런티어 실무
Opus 5.5로 옮기면 깨지는 요청 네 가지
`thinking: disabled` 나 수동 `budget_tokens` 를 보내면 400 오류가 난다. 생각은 항상 켜져 있고, 깊이는 effort(모델이 얼마나 오래 생각할지 정하는 설정값) 하나로만 조절한다. `tool_choice` 를 `any`·`tool` 로 지정하는 강제 도구 호출도 막혔고, 대신 `auto` 에 strict 도구 사용(도구 입력이 스키마를 반드시 따르게 하는 옵션)을 켜라고 안내한다. Claude API와 Google Cloud에서는 구형 `computer_20251124` 도구도 거부되며, Bedrock은 예외다.
오류 없이 조용히 바뀌는 것: 진행 메시지와 기본 effort
도구 호출 사이에 모델이 쓰던 짧은 진행 메모가 이제 텍스트가 아니라 thinking 블록으로 온다. 기본 표시 설정에서는 내용이 비어 있어, 이를 사용자 화면에 흘려보내던 앱은 오류 없이 말이 없어진다. 기본 effort도 high에서 medium으로 내려갔고, 같은 effort에서 생각은 더 길어졌다. Anthropic은 설정을 그대로 옮기지 말고 effort 스윕을 다시 돌리고 `max_tokens` 에 여유를 두라고 권한다.
모델·제품
Claude Opus 5.5 출시, 정가 20% 인하
Anthropic이 9월 22일 Opus 5.5를 Claude API·AWS·Google Cloud·Microsoft Foundry에 동시 출시했다. 가격은 백만 토큰당 입력 4달러, 출력 20달러로 Opus 5의 5달러·25달러에서 내렸고, 캐시 읽기는 0.20달러다. 벤더가 공개한 CursorBench 4.0 점수는 57.8%로 Opus 5의 46.6%보다 높다고 밝혔지만, 독립 벤치마크 결과는 아직 없어 확인 필요다.
연구·보안
Cisco Talos, AI를 품은 악성코드 추적 도구 CAIRN 공개
Talos가 악성코드 안에 박힌 프롬프트 템플릿·API 키·탈옥 문구 같은 흔적으로 AI 연동 악성코드를 찾는 오픈소스 도구 CAIRN을 냈다. 사람 조작 없이 돌아가는 AI 기반 C2(공격자가 감염된 기기에 명령을 내리는 통제 서버) 임플란트 CLOSEDQUORUM을 '최초 보고 사례'로 들었다. Talos 스스로 오탐이 흔하고 최종 판정은 역공학 검증이 필요한 연구 단계라고 단서를 달았다.
기업·전략
알파벳 Intrinsic, 산업용 로봇 기반 소프트웨어 오픈소스화
알파벳 산하 Intrinsic이 ROSCon 2026에서 Intrinsic Core를 Apache 2.0으로 공개했다. 하드웨어에 묶이지 않는 실시간 제어, 자세 추정, 동작·파지 계획, 시뮬레이션이 포함되고 ROS(로봇 소프트웨어의 사실상 표준 오픈소스 프레임워크)와 호환된다. CNC 기계 적재 자동화 참조 설계도 함께 냈는데, 자동화가 더딘 소규모 가공 공장을 겨냥했다고 밝혔다.
투자·시장
Snorkel AI, 기업가치 35억 달러로 3억5천만 달러 유치
Reuters 단독 보도에 따르면 Snorkel AI가 Insight Partners와 S32 주도로 3억5천만 달러를 모았고, 기업가치는 2025년 5월 13억 달러의 약 3배가 됐다. 소프트웨어 판매에서 프런티어 랩에 완성 데이터셋과 강화학습 환경(모델이 시행착오로 배우도록 만든 과제·채점 세트)을 직접 공급하는 쪽으로 바꾼 뒤 연환산 매출이 약 2천만 달러에서 3억5천만 달러로 늘었다고 한다. 매출 수치는 회사 측 발언 기반이라 확인 필요다.
정책·규제
유엔 안보리, 미·중 프런티어 AI 기업을 한자리에 불러 브리핑
유엔 안전보장이사회가 AI와 국제 안보를 주제로 OpenAI·Anthropic·DeepSeek·Moonshot 등 미·중 AI 기업을 함께 부르는 회의를 잡았다. 안보리의 AI 공식 토의는 2023년 7월 이후 두 번째다. 미·중 고위 당국자는 약 두 달 뒤 선전에서 AI 안전 협의를 이어가기로 했다고 Reuters를 인용해 전했다. 2차 매체 보도 기반이라 참석자 명단은 확인 필요다.
국내 AI·테크
과기정통부, 네이버클라우드 컨소시엄과 사이버보안 특화 AI 개발 착수
과학기술정보통신부가 9월 22일 '사이버보안 특화 AI 모델 개발' 주관 컨소시엄으로 선정된 네이버클라우드와 간담회를 열었다. 국내 보안 기업의 현장 데이터와 방어 기술을 묶어 국가 기반시설과 산업 현장에 바로 투입할 보안 모델을 만든다는 구상이다. 배경훈 부총리는 'AI 보안 주권'을 위해 독자 모델이 필요하다고 말했다. 예산과 일정은 기사에 나오지 않았다.
Opus 5.5에서 도입 기업이 먼저 볼 숫자는 40%가 아니라 20%다. 정가 인하 20%는 가격표로 확인되지만, 40%는 Anthropic이 '기본 설정, 전형적 작업'으로 계산한 값이다. 그 기본 설정에는 캐시 읽기 60% 인하와 기본 effort를 high에서 medium으로 낮춘 변화가 함께 들어 있다. 캐시를 거의 안 쓰는 단발성 호출이라면 절감 폭은 20% 근처에 머물고, 절감의 일부는 모델이 덜 생각해서 생긴 것일 수 있다. 예산 담당은 벤더 계산을 받아 적기 전에 자기 트래픽의 캐시 적중률부터 뽑아봐야 한다.
운영 쪽 부담은 비용보다 먼저 온다. 생각 끄기와 강제 도구 호출이 막히면서, 지연을 줄이려고 생각을 꺼두었거나 JSON 추출을 `tool_choice` 로 강제하던 파이프라인은 그대로 400 오류를 낸다. 더 까다로운 건 오류가 나지 않는 변화다. 진행 메시지가 thinking 블록으로 옮겨 가 화면이 조용해지는 문제는 테스트에서 놓치기 쉽다. 신규 계정은 대화 앞부분을 고치면 thinking 블록 재사용이 막히므로, 시스템 프롬프트를 중간에 편집하던 구조라면 대화를 덧붙이기만 하는 방식으로 바꿔야 한다.
다음 주 할 일은 명확하다. 모델 ID를 바꾸기 전에 스테이징에서 `tool_choice` 강제 지정과 thinking 비활성화 코드를 검색해 걷어내고, effort를 low·medium·high로 돌려 품질과 비용을 같이 잰다. 절감은 그 표가 나온 뒤에 말할 수 있다. 성능 우위는 아직 벤더가 고른 벤치마크 하나에 기대고 있어, 교체 결정이 아니라 병행 평가가 맞는 단계다.
- 성능 판단의 근거가 벤더가 공개한 CursorBench 4.0 하나뿐이다. 인프라 관점은 독립 평가가 나올 때까지 교체를 미루자고 했고, 현업 PM 관점은 다음 주 병행 평가로 직접 재면 된다고 했다. 해석은 병행 평가를 택했지만, 사내 평가 세트가 없는 팀에게는 이 권고가 비현실적일 수 있다.
- 기본 effort 하향이 품질 저하로 이어지는지는 기각했다. 같은 effort에서 생각이 길어졌다는 Anthropic 설명과 부딪히고, 어느 쪽이 우세한지 확인할 독립 자료가 없다. 절감의 몇 %가 '덜 생각해서'인지는 확인 불가다.
- 규제 관점은 새 생물 안전 분류기와 추론 추출 거절 범주가 기업 워크플로에서 예상치 못한 거절을 늘릴 수 있다고 봤다. 거절 빈도 데이터가 아직 없어 해석에서 뺐지만, `stop_reason: refusal` 처리와 대체 모델 설정이 없는 파이프라인에서는 이 점이 가장 먼저 문제가 될 수 있다.
- Snorkel의 매출 급증을 '사람이 만든 학습 데이터 수요가 계속된다'는 신호로 읽을지는 갈렸다. 예산 관점은 회사 측 수치라 보류했고, 이 해석은 Opus 5.5 이야기에 묶이지 않아 본문에서 뺐다.