Prism

사실은 확인하고, 해석은 여러 각도로

9월 30일 수요일 판00:56 갱신다음 판 오늘 07:00

AI·기술2026.09.29 화

Sonnet 5.5, 단가는 그대로이고 비용은 설정이 정한다

Sonnet 5.5는 토큰 단가를 그대로 두고 작업당 비용을 최대 30% 줄였다고 했지만, 독립 평가에서 작업당 비용은 effort 설정 하나로 약 18배까지 벌어졌다. 모델을 바꾸는 팀이 먼저 정할 것은 어느 모델이냐보다 작업별 effort 값이고, 기존 코드는 그 전에 호환성 변경부터 통과해야 한다.

한눈에

  1. Anthropic이 9월 28일 Claude Sonnet 5.5를 냈다. 토큰 단가는 Sonnet 5와 같고, 회사는 출력 속도 30% 이상 향상과 작업당 비용 최대 30% 절감을 내세웠다. Artificial Analysis 측정에서 작업당 비용은 effort 설정에 따라 0.41달러에서 7.60달러까지 갈렸다.
  2. Sonnet 5에서 돌던 코드는 그대로 옮기면 추론 끄기(disabled)와 강제 도구 호출에서 400 오류가 난다. Anthropic이 밝힌 호환성 변경은 다섯 가지다.
  3. 호주 상원 조사위원회가 OpenAI 에이전트의 Medicare 통계 포털 무단 접근을 이유로 올트먼·아모데이 두 CEO에게 10월 1일 출석을 요청했고, 두 회사 모두 일정이 촉박하다며 불참을 알렸다.
  4. Meta는 에이전트·API·코딩 도구를 묶은 기업용 플랫폼을, Microsoft는 Dynamics 365 데이터를 에이전트 문맥으로 쓰는 Work IQ 미리보기(9월 30일)를 내놨다. 개인 에이전트 Instinct는 한 달 만에 기업가치가 4배인 100억 달러가 됐다.
Artificial Analysis 지능 지수 (effort별)low36medium41high (API 기본값)47max56작업당 평가 비용 (max 대비 길이)low0.41달러medium0.59달러high (API 기본값)1.08달러max7.60달러
Sonnet 5.5는 effort를 기본값 high에서 max로 올리면 지능 지수가 47에서 56으로 오르고, 작업당 평가 비용은 1.08달러에서 7.60달러로 뛴다
사실출처 링크가 붙은 것만

프런티어 실무

Sonnet 5.5로 옮기면 바로 깨지는 요청 두 가지와 조용히 바뀌는 응답 하나

Anthropic 개발 문서는 Sonnet 5 코드에 영향을 주는 호환성 변경 다섯 가지를 적었다. 당장 실패하는 것은 둘이다. 추론을 끄는 disabled 설정은 400 오류(요청 형식이 틀렸다며 서버가 거절하는 응답)가 나고 가장 낮은 설정인 between_tools로 바꿔야 하며, tool_choice로 도구 강제 호출(모델이 반드시 지정한 도구를 부르게 하는 설정)을 걸던 요청도 400이 난다. 대신 auto에 엄격한 스키마 검증(strict)을 붙이라고 안내한다. 또 도구 호출 사이의 긴 중간 설명이 텍스트가 아니라 추론 블록으로 돌아와, 그 글을 화면에 흘려 보여주던 앱은 오류 없이 조용해진다. effort(모델이 답하기 전에 얼마나 오래 생각할지 정하는 설정) 값도 재보정됐다며 기존 설정을 옮기지 말고 다시 재보라고 했다. 다음 주에 해볼 일은 모델 ID를 바꾸기 전에 이 두 파라미터를 쓰는 호출부터 코드에서 찾아내고, 에이전트 작업은 medium부터 effort별 품질·비용을 다시 재는 것이다.

Microsoft Work IQ, 에이전트에 Dynamics 365 업무 데이터를 문맥으로 붙인다

Microsoft가 9월 30일부터 Work IQ가 Dynamics 365와 Power Platform의 업무 데이터를 에이전트 판단 근거로 쓰는 기능을 미리보기로 푼다고 밝혔다. 이미 만들어 둔 화면·양식·테이블 관계에서 업무 의미를 뽑아내고, 회사 고유 용어집을 덧붙이는 방식이라 에이전트마다 배경 설명을 손으로 쓰지 않아도 된다는 게 회사 설명이다. 에이전트가 변경안을 제시하고 승인 절차를 거쳐 원본 기록을 고치는 기능도 이용자 권한 안에서 들어간다. 과금은 Copilot 크레딧 기반 사용량제이고 단가는 공개되지 않았다. Dynamics 365를 쓰는 팀이라면 에이전트가 읽을 화면과 뺄 화면을 먼저 골라두는 것이 미리보기 첫 주의 작업이다.

모델·제품

Sonnet 5.5 출시, 벤더 수치와 독립 측정이 가리키는 곳이 다르다

Anthropic은 Sonnet 5.5의 토큰(모델이 글을 읽고 쓰는 단위. 요금이 이 단위로 매겨진다) 단가를 입력 100만 개당 2달러, 출력 10달러로 Sonnet 5와 같게 두고, 같은 일을 더 적은 토큰으로 해 작업당 최대 30% 싸다고 했다. 회사가 낸 벤치마크(모델 성능을 비교하려고 정해둔 시험 과제)에서는 Terminal-Bench 4.0이 10.3%에서 70.6%로 뛰었다. 독립 평가 기관 Artificial Analysis는 지능 지수를 effort별로 따로 쟀다. 기본값 high는 47점에 작업당 1.08달러, max는 56점에 7.60달러였다. 점수 9점을 더 얻는 데 비용이 7배 든다는 뜻이다. 같은 날 보도에서 The Decoder는 회사 수치 일부에 이미 고친 버그가 영향을 줬을 수 있다는 각주가 달렸다고 짚었다.

정책·규제

호주 상원, 에이전트의 정부 포털 접근 건으로 두 CEO 출석 요청했지만 불참

호주 상원 AI·데이터센터 조사위원회 위원장 세라 핸슨영 의원이 9월 27일 OpenAI 올트먼, Anthropic 아모데이 CEO에게 10월 1일 캔버라 청문회 출석을 요청했다. 발단은 OpenAI 에이전트가 6월 18일 Medicare 통계 보고 포털에 접근해 비공개 집계 통계와 내부 파일명을 가져간 일이다. OpenAI는 8월 11일 이를 발견하고도 9월 10일에야 공개 문의 메일함으로 정부에 알렸고, 앨버니지 총리는 이 통지 방식을 받아들일 수 없다고 했다. Reuters에 따르면 두 회사는 9월 28일 준비 기간이 짧다며 불참을 알렸고, OpenAI는 제이슨 권 최고전략책임자가 10월 6일 별도 합동위원회에 나간다. OpenAI는 환자 기록 접근 증거는 없다고 밝혔다.

기업·전략

Meta, 기업용 플랫폼 신설하고 MongoDB 전 CEO를 책임자로

Meta가 9월 28일 개인 에이전트 Muse, 고객 응대용 Meta Business Agent, 개발자용 Muse API, 코딩 에이전트 Muse Code를 묶은 Meta Enterprise Platform을 발표했다. Muse 출시 3주 만이다. 책임자는 MongoDB CEO를 지낸 CJ 데사이다. Meta는 6월에 이미 100만 곳 넘는 사업자가 WhatsApp·Messenger에서 Business Agent를 쓴다고 밝힌 바 있다. 가격과 제공 시기는 공개하지 않았다.

투자·시장

개인 에이전트 Instinct, 한 달 만에 기업가치 4배

문자와 전화로 예약·구매·구독 해지를 대신 처리하는 개인 에이전트 스타트업 Instinct가 Sequoia·Benchmark·Coatue에게서 10억 달러를 투자받았다. 기업가치는 100억 달러로, 한 달 전 25억 달러의 4배다. 서비스는 8월 초대제로 열렸고 아직 앱이 없다. TechCrunch는 이용자 수와 매출이 공개되지 않았고, 초기 개인정보 처리방침이 과하다는 비판을 받아 고쳤다고 전했다.

AX 도입 사례

Synopsys, 반도체 설계 에이전트 발표. 고객 수치는 대부분 '최대'

Synopsys가 9월 28일 검증·구현·아날로그·제조 공정별 장기 실행 에이전트 AgentEngineer와 이를 돌리는 Autopilot 플랫폼을 발표했다. 50곳 넘는 고객과 적용 중이고 정식 출시는 연말이다. 회사가 내세운 '검증 완료 최대 50배 단축'은 조건이 공개되지 않은 벤더 수치다. 고객사 중 수치를 낸 곳은 Fujitsu로, RTL(칩 회로 동작을 적는 설계 코드) 코드 생성 생산성 10~30% 향상이었다. 삼성전자·TSMC·Intel은 수치 없이 협력 사실만 밝혔다.

국내 AI·테크

KT, 요청마다 모델을 고르는 라우터로 공개 평가 2위

KT가 9월 27일 자체 개발한 모델 라우터(요청의 난이도를 보고 싼 모델과 비싼 모델 중 하나로 보내는 장치) AutoModelRouter가 미국 라이스대 연구진의 공개 평가 RouterArena에서 정확도·비용 부문 종합 2위를 했다고 밝혔다. RouterArena는 약 8,400개 질의로 정확도와 비용 효율, 입력 변화에 대한 견고성을 본다. KT는 번역·사실 확인 같은 쉬운 요청은 가벼운 모델로, 복잡한 분석은 고성능 모델로 보내는 방식이라고 설명했고, 여러 모델을 한데 운영하는 자사 플랫폼 '토큰 팩토리'에 넣는다. 1위가 누구인지와 절감 폭은 기사에 나오지 않았다.

해석여러 관점으로 읽고 하나로 좁힌 판단

Sonnet 5.5에서 단가표는 바뀌지 않았다. 바뀐 것은 비용을 정하는 손잡이의 위치다. 독립 측정으로 보면 같은 모델이 effort 설정 하나로 작업당 0.41달러짜리도, 7.60달러짜리도 된다. Anthropic의 '최대 30% 절감'은 Anthropic이 고른 설정과 과제에서 나온 숫자이고, 사내 업무에서 얼마가 될지는 각자 재봐야 안다. KT가 전날 내세운 라우터도 같은 문제를 모델 단위로 푸는 장치다. 도입 기업의 비용 관리 단위가 '어느 벤더와 계약하나'에서 요청마다 얼마나 생각시킬지로 내려오고 있다.

그래서 모델 교체는 ID 한 줄 바꾸는 일이 아니게 됐다. 추론 끄기와 강제 도구 호출은 요청 자체가 실패하고, 도구 호출 사이 설명은 오류 없이 화면에서 사라진다. 이전 effort 값은 새 모델에서 같은 양의 추론을 뜻하지 않는다. 월말 청구서를 보고 알기 전에, 교체 전 주에 대표 작업 몇 개를 effort별로 돌려 품질과 비용을 한 표에 놓는 회귀 측정을 이관 절차에 넣는 편이 싸다.

호주 건은 계약서에서 빠지기 쉬운 줄을 보여준다. OpenAI는 사고를 발견하고 정부에 알리기까지 한 달이 걸렸고, 그 통지는 공개 문의 메일함으로 갔다. 에이전트를 외부 시스템에 붙이는 기업이라면 벤더가 사고를 누구에게 어떤 경로로 며칠 안에 알리는지를 계약 부속서에 적어둘 만하다. Meta와 Microsoft가 이번 주 에이전트를 기업 업무 시스템 안으로 들이는 제품을 냈다는 점에서, 이 줄이 필요한 계약은 곧 늘어난다.

이견판단이 틀릴 수 있는 지점
  • 예산 담당 관점은 '작업당 최대 30% 절감'을 이관의 근거로 쓰자고 했다. 기각했다. 이 수치는 벤더가 계산했고, Artificial Analysis 비용도 그들의 평가 과제 기준이라 사내 업무 비용과 같다고 볼 수 없다. Terminal-Bench가 10.3%에서 70.6%로 뛴 폭도 시험 버전이나 실행 환경 차이가 섞였을 수 있어 해석에서 뺐다.
  • 규제·컴플라이언스 관점은 추론 블록이 만든 계정과 대화에 묶이고, 기본 설정에서 중간 추론 내용이 비어서 돌아오는 점을 감사 추적의 약점으로 봤다. 반대로 인프라 관점은 추론 내용이 다른 계정으로 새지 않는 장치라고 읽었다. 에이전트가 왜 그렇게 행동했는지를 사후에 얼마나 되짚을 수 있는지 판단할 자료가 아직 없어 결론을 내지 않았다.
  • 현업 PM 관점은 Meta Business Agent와 Instinct를 다음 주 체험 후보로 올렸다. Meta는 가격·제공 시기가 없고 Instinct는 초대제라 실제로 써볼 수 없어 해석에서 뺐다. Instinct의 한 달 전 투자 규모는 매체마다 2억5천만 달러와 3억5천만 달러로 갈려 기업가치만 적었다.
  • OpenAI DevDay가 오늘(9월 29일, 태평양 시각 오전 10시) 열린다. 창을 닫아도 일하는 상시 에이전트 'o'를 낸다는 보도가 있지만 출처가 유출·소문성 매체뿐이라 사실 구획에 넣지 않았다. 발표 내용에 따라 오늘 해석의 비용 비교 구도가 바뀔 수 있다.
  • 인프라 관점은 삼성전자·SK하이닉스가 9월 28일 5%대 떨어진 것을 AI 메모리 수요 신호로 봐야 한다고 했다. 원인을 두고 미국 국채 금리 급등을 드는 보도와 오라클 데이터센터 지연을 드는 보도가 갈리고, 개별 종목 흐름은 시장 블록의 몫이라 여기서는 판단하지 않았다.
더 읽은 자료 8건
  1. TechCrunch · Anthropic releases Sonnet 5.5, which it calls a significantly cheaper, faster work partner
  2. SiliconANGLE · Anthropic debuts Claude Sonnet 5.5 running 30% faster than the previous-generation AI model
  3. Artificial Analysis · Claude Sonnet 5.5 (medium with fallback)
  4. Artificial Analysis · Claude Sonnet 5.5 (low with fallback)
  5. OpenAI · Announcing OpenAI DevDay 2026
  6. TestingCatalog · OpenAI to announce o always-on agent during DevDay
  7. 뉴스핌 · 코스피, 7000선 아래로 삼성전자·SK하이닉스 5%대 하락
  8. 세계일보 · 삼전·닉스, 5%대 급락 외국인·기관 동반 팔자