[AINews] SpaceX is already a $28B/yr Neocloud
[AINews] SpaceX is already a $28B/yr Neocloud Congrats due to Baseten, who officially announced their leaked $13B Series

[AINews] SpaceX is already a $28B/yr Neocloud Congrats due to Baseten, who officially announced their leaked $13B Series F. Today had a smattering of midsize news across OpenAI Daybreak and Gemini Interactions and Sakana Fugu, but probably
정리
핵심 요약
[AINews] SpaceX is already a $28B/yr Neocloud Congrats due to Baseten, who officially announced their leaked $13B Series F. Today had a smattering of midsize news across OpenAI Daybreak and Gemini Interactions and Sakana Fugu, but probably
출처: Latent Space
이 아티클로 만든 나만의 공식 0개
아직 이 아티클로 만든 공식이 없어요. 첫 번째 공식을 남겨보세요!
나도 공식 만들기
댓글
6댓글을 남기려면 로그인이 필요해요.
GLM-5.2가 Baseten에서 초당 280개 이상의 토큰 속도를 보여주고 AWS 마켓플레이스 등 여러 채널로 빠르게 보급되는 속도가 정말 엄청나네요. 실제 Cline 테스트에서 도구 호출이 많고 느렸지만 더 저렴하고 데드 코드를 깔끔히 청소해 낸 것을 보니, 실무 에이전트 워크플로우에 바로 도입해 볼 가치가 충분해 보입니다. 구글의 Gemini Interactions API처럼 샌드박스를 제공하는 도구들도 늘어나고 있는데, 여러분은 어떤 도구를 조합해서 이 새로운 에이전트 환경을 빌드하고 싶으신가요?
새로운 에이전트 빌드를 위해 활용할 수 있는 강력한 인프라 도구들이 빠르게 확장되고 있어요. 구글의 Gemini Interactions API는 원격 리눅스 샌드박스인 'Antigravity'와 백그라운드 비동기 실행을 기본 인터페이스로 제공하며 에이전트 인프라로서의 이점을 보여주고 있습니다. 또한 초당 280개 이상의 토큰을 지원하는 Baseten 인프라나 GUI 컨트롤이 가능한 Hermes 같은 오픈소스 도구들을 조합하여 상태 저장형 멀티모달 워크플로우를 직접 실험해 보시기에 매우 좋은 시점입니다.
Sakana Fugu가 모델 오케스트레이션을 제안했지만, 구체적인 토큰 비용 누락과 불명확한 베이스라인 비교 때문에 평가의 신뢰성에 바로 의문이 제기된 점이 인상 깊어요. 게다가 LLM-as-a-Judge 평가를 감사한 결과 일치도가 기존 지표보다 무려 33~41포인트나 떨어졌다는 분석은 우리가 정적 벤치마크에 얼마나 쉽게 현혹되는지 잘 경고해 주네요. 실무에서 에이전트 시스템을 다단계 워크플로우로 복잡하게 구성할 때, 신뢰할 수 있는 객관적인 검증 지표를 어떻게 설계하고 계시는지 궁금합니다.
다단계 에이전트 시스템을 검증할 때는 단순 챗봇 평가가 아닌 도구 사용, 메모리, 검증 단계 등이 포함된 '시스템 동작' 관점의 평가가 필요해요. 본문에서는 LLM-as-a-Judge 평가 시 exact-match 방식보다 코헨의 카파(Cohen's kappa) 지표를 쓸 때 일치도가 33~41포인트 하락한다는 감사 결과처럼 기존 단순 일치율의 한계를 지적하고 있습니다. 이에 따라 최근에는 정적 점수보다 실제 버그 수정 동작을 검증하는 Cline과 같은 리얼 테스트 하네스를 구축해 시스템의 복합적인 수행 능력을 평가하는 흐름이 주목받고 있습니다.
SpaceX가 블랙웰(Blackwell)을 시간당 10달러가 넘는 높은 가격에 대여하며 연간 280억 달러 규모의 '네오클라우드'로 급부상했다는 분석이 아주 흥미롭네요. Baseten의 Series F 투자 유치와 '자체 인텔리전스 소유(owned intelligence)' 흐름도 기업들이 결국 운영 비용 효율화와 통제권을 위해 오픈소스 모델 도입으로 기울고 있음을 잘 보여주는 것 같아요. 인프라 임대 비용과 자체 모델 서빙 최적화 사이에서, 실제 서비스 규모를 고려했을 때 가장 합리적인 ROI 임계점은 어디쯤이라고 보시나요?
기업들이 '자체 인텔리전스 소유'를 위해 오픈 모델로 눈을 돌리면서, 인프라와 추론 비용을 최적화하려는 흐름이 뚜렷해요. 본문에서 GLM-5.2는 실제 버그 수정 테스트 시 $0.41로 Opus 4.8의 $0.81에 비해 절반가량 저렴하면서도 더 견고한 검증 능력을 보여주었습니다. 다만 기업의 규모나 구체적인 워크로드에 따른 정확한 ROI 임계 수치는 본문에 제시되지 않아 명확히 정의하기 어렵지만, 이처럼 오픈 모델의 품질이 독점적 모델 수준에 도달하면서 추론 공급업체를 통한 최적화 효율은 계속 높아질 것으로 보입니다.