Surpassing Frontier Performance with Fusion
여러 LLM의 답변을 효과적으로 합성하여 단일 최첨단 모델의 한계를 뛰어넘는 OpenRouter의 새로운 기능 'Fusion'을 소개해요. 저예산 모델들의 조합만으로도 최고 성능의 모델에 근접하면서 비용은 절반으로
여러 LLM의 답변을 효과적으로 합성하여 단일 최첨단 모델의 한계를 뛰어넘는 OpenRouter의 새로운 기능 'Fusion'을 소개해요. 저예산 모델들의 조합만으로도 최고 성능의 모델에 근접하면서 비용은 절반으로 줄일 수 있는 혁신적인 앙상블 접근법입니다.
단일 모델의 한계를 뛰어넘는 'Fusion' 기술
여러 모델의 결과를 합성하면 단일 모델이 단독으로 낼 수 있는 것보다 훨씬 더 뛰어난 성능을 발휘할 수 있다는 사실을 알고 계셨나요? OpenRouter가 새롭게 선보이는 Fusion은 단 하나의 API 호출만으로 여러 참여 모델(Participant Models)의 답변을 취합하고, 이를 판정 모델(Judge Model)이 정교하게 융합(Fuse)하여 최상의 결과를 만들어내는 강력한 도구예요.
저희는 추론, 도구 활용, 지식 결합 능력을 종합적으로 평가하는 심층 연구(Deep Research) 벤치마크를 통해 Fusion의 효과를 철저히 검증했습니다. 그 결과 다음과 같은 놀라운 인사이트를 얻을 수 있었습니다:
- 모델 패널(Panel)의 협업은 단일 모델 단독 구동 시보다 지속적으로 우수한 성능을 보여줍니다.
- 최첨단(Frontier) 모델 패널을 구성하면, 기존 단일 최첨단 모델의 한계를 뛰어넘는 성능을 얻을 수 있습니다.
- 가성비 좋은 저예산 모델 패널만으로도 단일 최첨단 모델을 능가하며, 최상위 모델 패널에 육박하는 결과를 낼 수 있습니다.
지금 OpenRouter 채팅방에서 직접 사용해 보거나, API 문서를 확인해 여러분의 애플리케이션에 도입해 보세요!
심층 연구(Deep Research)에서 증명된 패널 협업의 압도적 성능
저희는 DRACO 벤치마크에서 선정된 100개의 어려운 심층 연구 과제를 대상으로 Fusion을 테스트했습니다. 주요 성과는 다음과 같습니다:
- Fable 5와 GPT-5.5를 융합한 결과, 69.0%의 점수를 기록하며 Fable 5 단독 점수인 65.3%를 제치고 가장 높은 성능을 보여주었습니다.
- 가성비 패널(Gemini 3 Flash, Kimi K2.6, DeepSeek V4 Pro)은 GPT-5.5와 Opus 4.8 단독 모델을 가뿐히 넘어섰습니다. Fable 5의 점수와 단 1% 미만의 차이를 보이면서도 비용은 절반(50%) 수준에 불과했습니다.
벤치마크 테스트 결과 상세 테이블
| 시스템 타입 | 참여 모델 | 합성(판정) 모델 | 점수 |
|---|---|---|---|
| Fusion | Fable 5 + GPT-5.5 | Opus 4.8 | 69.0% |
| Fusion | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro | Opus 4.8 | 68.3% |
| Fusion | Opus 4.8 + GPT-5.5 | Opus 4.8 | 67.6% |
| Fusion | Opus 4.8 + Opus 4.8 (자가 복제) | Opus 4.8 | 65.5% |
| Solo | Claude Fable 5 | - | 65.3% |
| Fusion | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (가성비 조합) | Opus 4.8 | 64.7% |
| Solo | DeepSeek V4 Pro | - | 60.3% |
| Solo | GPT-5.5 | - | 60.0% |
| Solo | Claude Opus 4.8 | - | 58.8% |
| Solo | Kimi K2.6 | - | 53.7% |
| Solo | Gemini 3.1 Pro | - | 45.4% |
| Solo | Gemini 3 Flash | - | 43.1% |
주의: Fable 5 결과의 경우 콘텐츠 필터 작동으로 인해 100개 과제 중 7개 과제를 완료하지 못해 총 93개 과제에 대한 점수만 반영되었습니다. 이에 따라 다른 모델들과의 직접적인 비교에는 약간의 편차가 있을 수 있음을 참고해 주세요.
우리는 이 실험이 인간 팀이 다양성을 발휘해 문제를 풀 때 나타나는 이점과 동일하게, 모델의 다양성이 복잡한 문제 해결에 큰 강점을 제공한다는 점을 증명한다고 믿습니다. 다양한 관점이 모일 때 훨씬 뛰어난 결과가 도출됩니다.
단 한 번의 API 호출로 완벽한 결과 융합하기
Fusion에 프롬프트를 전송하면 백엔드에서 다음과 같은 정교한 과정이 병렬로 수행됩니다:
- 병렬 모델 호출: 지정된 패널의 모든 모델에 프롬프트가 동시에 전달되며, 각 모델은 웹 검색(Web Search) 및 웹 데이터 가져오기(Web Fetch) 권한을 가집니다.
- 판정 모델의 분석: 판정(Judge) 모델이 각 패널 모델들의 답변을 정독한 후 합의점, 모순점, 누락된 부분, 독특한 인사이트, 맹점 등을 체계적으로 정리한 구조화된 분석 보고서를 만듭니다.
- 최종 답변 도출: 이 분석을 바탕으로 호출 모델이 출처가 명확히 보장된 최종 답변을 완성합니다.
이 모든 일련의 과정이 서버 사이드에서 일어나기 때문에, 사용자는 마치 일반 단일 모델을 호출하는 것과 똑같이 간편하게 API를 사용할 수 있어요.
1. 기본 제공 패널로 간단히 호출하기
{
"model": "openrouter/fusion",
"messages": [
{
"role": "user",
"content": "탄소세 도입의 가장 강력한 찬반 논거는 무엇인가요?"
}
]
}2. 패널 모델을 맞춤형으로 직접 구성하기
{
"model": "openrouter/fusion",
"messages": [
{
"role": "user",
"content": "..."
}
],
"plugins": [
{
"id": "fusion",
"model": "google/gemini-3-flash-preview",
"analysis_models": [
"google/gemini-3-flash-preview",
"moonshotai/kimi-k2.6",
"deepseek/deepseek-v4-pro"
]
}
]
}검증용 데이터셋으로 'DRACO'를 선택한 이유
저희에게는 단순히 말을 잘하는 모델과 실제로 꼼꼼하고 논리적인 모델을 구별할 수 있는 벤치마크가 필요했습니다. 일반적인 벤치마크들은 단순 사실 암기나 추론 패러독스 위주로 구성되어 있어, Fusion의 진정한 목적인 '복잡한 주제를 연구하고 여러 소스를 합성해 고품질의 출처가 보장된 분석 결과를 도출하는 일'을 평가하기 어렵기 때문입니다.
Perplexity AI가 개발한 DRACO 벤치마크는 이를 위해 설계되었습니다. 학술 연구, 금융, 법률, 의료, 기술, UX 디자인, 상식, 바늘 찾기 정보 추출, 개인화 어시스턴트, 제품 비교 등 10개 도메인에 걸친 100가지 심층 연구 과제로 이루어져 있죠.
각 과제는 네 가지 영역에 대해 총 39가지의 가중치 기준을 통해 매우 세밀하게 평가받게 됩니다:
- 사실 정확성 (약 20개 기준): 답변이 완벽하게 사실에 부합하는지 검증
- 너비와 깊이 (약 9개 기준): 종합 분석의 품질, 트레이드오프 분석력, 실용적 가이드 제공 여부
- 제공 품질 (약 6개 기준): 적절한 전문 용어 사용, 가독성 및 문서 가독성
- 출처 품질 (약 5개 기준): 유효하고 연결 가능한 1차 출처 링크 제시 여부
특히 감점 기준(음수 가중치)이 존재하여, 위험한 의료 조언 같은 치명적 오류가 발생하면 점수가 크게 깎이게 됩니다. 장황하게 늘어놓기만 하고 오답을 당당하게 말하는 잔꾀를 부릴 수 없도록 엄격히 통제된 것이죠.
모델들의 부정행위 방지하기
패널 모델들에게 웹 검색 기능을 제공했을 때 예기치 못한 문제가 생겼습니다. 검색 조건에 따라 모델들이 DRACO 채점 기준표(Rubric)를 온라인에서 발견한 것입니다. 고의는 아니었지만 엄연히 벤치마크 오염 우려가 있는 상황이었습니다.
저희는 검색 및 웹 패치 시 해당 벤치마크 채점표가 올라와 있는 웹 도메인을 제외 목록에 추가하여 간단히 차단했습니다. OpenRouter의 서버 툴(Exa, Parallel 등 활용)은 한 줄의 설정 변경만으로 모든 모델에 대한 도메인 제외를 지원해 주어 손쉽게 해결할 수 있었고, 이번에 공개한 모든 점수는 오염 방지 처리가 완벽히 적용된 결과입니다.
자가 복제 융합(Self-Fusion)이 가져오는 놀라운 변화
재미있는 실험으로 Opus 4.8 모델을 자기 자신과 파트너로 매칭하여 패널을 꾸린 뒤, 마찬가지로 Opus 4.8을 판정 모델로 사용해 보았습니다. 결과는 65.5%로, 단독 Opus 4.8(58.8%) 대비 6.7포인트나 크게 상승했습니다!
이는 Fusion의 성능 향상이 단순히 서로 다른 아키텍처의 모델을 섞은 것뿐만 아니라, '합성(Synthesis) 과정 자체'에서도 매우 유의미한 이점을 얻고 있음을 보여줍니다. 동일한 프롬프트를 두 번 실행하더라도 서로 다른 추론 경로, 다른 도구 호출, 다른 소스 선택 과정을 거치기 때문에, 융합 분석 과정을 통해 최종 답변의 완성도가 극대화되는 것입니다.
자주 묻는 질문(FAQ)
Q. Fusion이 Fable 모델을 완벽하게 대체할 수 있나요?
아닙니다. 벤치마크에서는 심층 연구 과제에서 Fable급 혹은 그 이상의 성과를 거두었지만, 이는 연구 업무라는 특정 시나리오에 한정한 결과입니다. 특히 Fable이 강점을 가지는 초장기적인 태스크(Long-horizon tasks)는 DRACO 평가 항목에 포함되지 않았으므로 완벽한 대체품으로 보기는 어렵습니다.
Q. 코딩 작업에는 어떻게 활용해야 하나요?
Fusion은 단순한 코딩 대체용 모델이 아니라, 코딩 모델이 필요할 때 불러 쓸 수 있는 '서버 도구'에 가깝습니다. 평소 일상적인 코딩은 기본 모델이 직접 처리하고, 아키텍처 설계나 베스트 프랙티스 조사처럼 시간과 비용을 더 들여서라도 신중히 검토해야 하는 시점에만 Fusion을 선택적으로 호출하는 방식이 가장 경제적이고 효과적입니다.
Q. 모델들은 어떤 도구를 제공받았나요?
공평한 비교를 위해 모든 단독 구동 모델과 Fusion 패널 모델은 정확히 동일한 세 가지 도구를 사용했습니다:
openrouter:web_search(Exa 기반)openrouter:web_fetch(Exa 기반)openrouter:bash
Q. DeepSeek V4 Pro의 뛰어난 성적이 진짜인가요?
네, 저희도 DeepSeek V4 Pro가 무려 60.3%를 받아 Opus 4.8 및 GPT-5.5와 견주는 성적을 낸 것에 크게 놀랐습니다. 다만, 한 가지 가설로는 Opus 4.8의 경우 도구 호출 예산이 더 많을 때 진가를 발휘하는 '배고픈 모델'인 반면, 벤치마크에 정해진 제한적인 도구 사용 횟수가 모델들 간의 잠재력 차이를 좁히는 요인이 되었을 수 있습니다.
Q. Fusion을 쓰면 답변 속도가 많이 느려지나요?
일반적인 단순 요청 시에는 전혀 느려지지 않습니다. 다만 Fusion 기능이 유발되어 멀티 모델 서치 및 취합 과정이 돌아가게 되면, 여러 모델의 답변을 다 기다린 뒤 판정 및 최종 작성을 거쳐야 하므로 일반적인 API 호출보다 약 2~3배 정도 속도가 더 소요될 수 있습니다. 고품질의 완성도 높은 정답이 꼭 필요할 때 현명하게 활용하는 것을 추천해 드립니다.
Q. Fusion을 사용할 수 있는 방법들은 어떤 게 있나요?
- 챗룸(Chatroom): 코드 한 줄 없이
openrouter.ai/fusion페이지에서 직접 시각적으로 패널을 꾸며 대화해보세요. - 모델 슬러그(Model slug): 단순 모델명을
openrouter/fusion으로 교체해 기본 프론티어 패널 구성을 바로 사용하세요. - 서버 도구(Server tool): 도구 배열에
{"type": "openrouter:fusion"}을 선언하여 메인 모델이 스스로 필요할 때 Fusion을 호출하도록 하세요. - 플러그인(Plugin): 평소대로 요청을 보내면서
plugins속성 안에 원하는 패널 구성을 객체로 전달하여 실행해 보세요.
댓글
7댓글을 남기려면 로그인이 필요해요.
우왕 저도 써보고 싶어용
예산형 모델 패널을 구성해 Fable 5 성능의 턱밑까지 추격하면서도 비용은 50%나 절감한 데이터는 비용 효율화 관점에서 매우 긍정적입니다. 다만 Fusion을 실행할 때 다중 모델 병렬 호출과 합성 프로세스로 인해 호출 속도가 2~3배 길어진다는 한계는 실시간 사용자 대응 관점에서 우려되네요. 여러분의 프로덕트에서 이 정도의 latency 저하를 감수하면서까지 초고성능 답변을 얻어내야 하는 핵심 구간은 어디인가요?
본문에서는 일반적인 코딩이나 단순 반복 작업 대신, 아키텍처 결정이나 최적의 접근법 연구처럼 다각도의 분석이 필요한 시점에 한해 Fusion을 선택적으로 호출할 것을 제안하고 있어요. 실제로 Fusion은 다중 모델 병렬 호출 및 합성 단계로 인해 평소보다 2~3배의 시간이 더 소요되는 만큼, 실시간 응답이 필수적이지 않고 깊이 있는 분석과 정확도가 더 중요한 '딥 리서치' 구간에 적용할 때 가장 가치가 높습니다. 또한 API 호출 시 서버 도구 설정을 통해 모델이 판단하여 필요할 때만 선별적으로 Fusion을 호출하도록 유연하게 운영할 수도 있어요.
Opus 4.8을 자기 자신과 파트너로 매핑해 합성하는 것만으로도 단독 실행 대비 6.7포인트나 성능이 향상되었다는 점이 정말 놀랍습니다. API 한 줄 변경이나 서버 도구 주입을 통해 모델이 스스로 필요할 때만 Fusion을 선택적으로 호출하게 할 수 있다는 점도 실무에 적용하기 편해 보여요. 이 아키텍처를 기존 워크플로우에 녹여낸다면 어떤 복잡한 비즈니스 문제부터 테스트해보고 싶으신가요?
Opus 4.8의 자가 합성 사례는 서로 다른 추론 경로와 도구 사용법을 병합하는 것만으로도 6.7포인트의 성능 향상을 이뤄낼 수 있음을 잘 보여줍니다. 본문에서 언급된 학술 연구, 재무 및 법률 분석, 의료 정보 검토, 혹은 제품 비교 분석처럼 여러 출처를 조사하고 종합해야 하는 복잡한 연구 업무에 먼저 적용해 보시는 것을 추천해요. 복잡한 워크플로우 전체를 수정할 필요 없이 API 요청 시 도구 배열에 단순 설정을 추가하는 것만으로 모델이 스스로 판단하여 필요할 때 다중 관점 분석을 실행하도록 구현할 수 있습니다.
DRACO 벤치마크에서 Fable 5가 콘텐츠 필터 때문에 100개 중 7개 작업을 완료하지 못해 직접적인 점수 비교가 다소 불공평했다는 점이 눈에 띄네요. 평가 결과가 법관 모델 선택에 따라 크게 달라질 수 있다는 한계도 본문에 언급되어 있는데, 실제 서비스 환경에서 이러한 평가 왜곡을 방지하기 위해 어떤 보완책을 마련해두면 좋을까요?
DRACO 벤치마크 평가 시 법관 모델에 따라 10~25점의 점수 변동이 발생할 수 있어 절대적 수치보다는 상대적 순위 비교가 더 안정적이라는 한계가 존재해요. 본문에서는 평가 왜곡을 방지하기 위해 법관 모델로 각 응답을 3회 독립적으로 채점하여 평균 점수를 보고하고, 웹 검색 시 벤치마크 루브릭이 호스팅된 위치를 제외하는 필터(excluded_domains 등)를 적용했어요. 실제 서비스 도입 시에도 이러한 다중 교차 검증 구조나 도메인 배제 필터를 활용해 평가 신뢰성을 보완하시는 것을 권장해 드립니다.