같은 오픈 모델도 OpenRouter 공급자에 따라 도구 호출 점수가 20점 넘게 갈렸다

같은 오픈 모델도 OpenRouter 공급자에 따라 도구 호출 점수가 20점 넘게 갈렸다

  • iMessage AI 비서 Olly 운영자는 누적 1,800만 메시지 중 약 3분의 1을 OpenRouter 경유 오픈 모델로 처리하며 공급자별 장애 사례를 수집했음
  • 동일한 DeepSeek V4 Flash 0731 가중치라도 32일 평균에서 DeepSeek 1차 공급자는 GPQA 90.2%, TAU-Bench 81.3%였지만 DigitalOcean은 75.3%, 58.4%로 도구 호출 점수가 20점 이상 차이 남
  • 이미지 입력 시험에서 DeepInfra의 Qwen3.5 122B 엔드포인트는 K를 R이나 I로 읽고 빨강을 파랑이라 답했으며, Venice와 Together의 MiniMax M3 엔드포인트는 이미지를 받지 못했는데도 200 OK를 반환함
  • 모든 공급자가 reasoning.effort 값을 받지만 DeepSeek V4 Flash 0731의 low·high·max 반복 시험에서 DigitalOcean, GMICloud, Mancer, Venice 등은 추론 토큰 수가 설정에 따라 달라지지 않았음
  • 공급자가 선언한 FP4·FP8 양자화 필터는 품질 보증 수단이 아니었으며, FP4 공급자와 FP8 공급자 모두 GPQA 점수가 크게 갈리고 일부 공급자는 70% 수준에 머묾

Hacker News opinions

이거 보고 나니 너무 끔찍한데, 대안이 뭐임?

난 opencode go와 opencode work는 안정적으로 썼음. 다만 DeepSeek 접근을 막으면서 중국으로 데이터가 간다는 데 동의하라고 한 뒤로, 이전 데이터 처리도 믿기 어려워졌고 DeepSeek 가격도 많이 올랐음.

난 Vercel AI Gateway를 써봤음. 모델 목록은 에 있음.

이 문제는 OpenRouter만의 문제가 아니라 LLM 서빙 전반의 문제임. 다른 메타 공급자도 비슷할 거고, 공급자와 직접 계약해도 품질과 기능 차이는 남음. 오픈 웨이트 모델 보급을 막는 가장 큰 문제 중 하나라고 봄.

난 그냥 한 공급자를 쓰겠음. 그러면 최고 품질 공급자를 고르고 집계 계층과 나머지 공급자 복잡성을 피할 수 있는데, 왜 굳이 벤더 중립성 때문에 작동하지 않는 구성을 택하는지 모르겠음.

오픈소스 모델만 필요하면 cline과 opencode가 일반 API용 종량제와 구독제를 제공함.

OpenRouter는 한 API로 모델을 빨리 시험하기엔 좋음. 하지만 운영에는 안 쓰겠고, 고른 뒤에는 보통 더 싼 1차 공급자로 직접 갈 것 같음. API 전환 비용도 거의 없고 기능 플래그로 둘 다 붙일 수 있음.

난 Requesty를 써봤는데 공급자를 고정하고 자체 라우팅 정책을 만들 수 있어서 결과를 어느 정도 예측할 수 있었음.

난 Merge AI Gateway를 쓰고 있는데 지금까진 괜찮았음. 새 모델을 빨리 추가하고 지원 응답도 빨랐음.

Fireworks는 모델을 직접 호스팅하니 글에서 말한 일관성 문제는 줄일 수 있을 듯함. 몇 달 전 비교했을 때 내가 잠깐 써본 선택지는 Fireworks와 OpenRouter였음.

인기 LLM 게이트웨이가 대형 공급망 공격을 당한 걸 보고 직접 만들었음. 2주 정도 걸렸고 moonshot, qwen, Gemini, zhipu, Anthropic, DeepSeek, OpenAI를 내부 표준 형식과 공급자별 어댑터로 연결함.

비용 얘기가 더 있었으면 했음. OpenRouter 크레딧은 생각보다 너무 빨리 닳더라.

데이터 수집 공급자를 피하려고 기본 공급자를 막아 설정했는데 이상한 동작을 봤음. 잘 검증된 공급자를 거르는 건 필요하고 OpenRouter에 그 기능은 있음.

그래도 글의 요지는 신뢰 공급자로 분류된 곳도 성능이 일관되지 않고, 모델마다 결과가 다르다는 거임.

나도 모델 시험하려고 OpenRouter에 $100 넣었음. 크레딧을 다 쓰고 모델을 고르면 당분간은 원래 공급자로 가는 게 맞겠다고 생각함.

엄격한 JSON 출력도 모든 엔드포인트에서 작동하지 않더라. 결국 하나씩 시험해서 통과한 곳만 허용 목록에 넣고 있음.

OpenClaw와 OpenRouter를 쓰다가 같은 프롬프트 결과가 너무 들쭉날쭉해서 그만뒀음. OpenClaw 문제인 줄 알았는데 공급자마다 차이가 난다는 건 생각도 못 했음.

내 API 키가 싱가포르에서 쓰였는데 일일 한도 $10인데도 $100이 빠져나갔음. 프런티어 모델도 전부 차단됐고, 국가나 IP 같은 키 제한도 없었던 것으로 보임.

난 반대 경험임. 한도를 설정하고 실제로 닿는 걸 नियमित적으로 확인하면서 의존하고 있음. 지원팀 분석이나 사후 보고가 있었는지 궁금함.

API 키 IP 제한은 이제 실제로 있음.

해커뉴스
Rune, Go로 만든 네이티브 IDE를 GPLv3로 공개하고 기여자 수익 배분 제도 예고Brown 연구진, async/await 런타임 7종의 관찰 가능한 의미론을 9개 설계 축으로 분류141가지 신체 현상을 부위·유형별로 정리한 Show HN, 제작자는 AI 사용과 위키백과 출처 공개Tinybird 공동창업자, ClickHouse 18.4부터 6년간 페타바이트 클러스터 운영 경험 정리GrapheneOS, Jetpack Compose·Material 3로 다시 만든 Messages 13 공개MIT Logo 소개: 거북이 그래픽으로 배우는 Lisp 계열 언어의 대화형·확장형 설계구글 앱 광고 $220 집행 뒤, 청구 설치 56건 중 33건에서 봇팜 의심 패턴 발견EPA, 데이터센터 등 산업시설 대기오염 허가의 주민 통지·의견수렴 의무 폐지 추진조사팀, OpenAI 에이전트가 RubyGems에 2,480개 패키지를 올려 API 키 탈취를 시도했다고 주장필즈상 수상자 25명, AI의 수학 문제 풀이 경쟁이 인간의 이해와 전승을 해친다고 경고RTK, Terminal-Bench에서 DeepSeek 비용 평균 17% 증가Magit의 Git 워크트리 단축키와 AI 에이전트 병렬 작업 흐름 정리성과 없이 경쟁만 격화되는 상태를 뜻하는 중국어 '네이쥐안'IAEA가 설명한 체렌코프 복사, 물속 빛보다 빠른 하전 입자가 만드는 청색광웨이모식 편의가 연구 협업자를 LLM으로 대체한다는 주장HN 이용자들, AI 글 쏠림과 비AI 기술 글 노출 감소를 두고 필터·편집 필요성 논쟁Anthropic, Claude를 18세 이상 전용으로 전환하고 Yoti 연령 인증 도입같은 오픈 모델도 OpenRouter 공급자에 따라 도구 호출 점수가 20점 넘게 갈렸다ERSC, Git 프로토콜은 유지하고 자체 스토리지 엔진으로 차세대 VCS를 만들겠다고 주장구글, Alt+Space로 호출하는 Windows용 Gemini 데스크톱 앱 출시로컬 Qwen 27B에서 코딩 하네스 9종 비교, OpenCode 첫 응답 226초·Chad 26초90분 중강도 사이클링과 6회 30초 전력질주, 일부 심대사 바이오마커 변화가 비슷YuE2, 기호 악보를 먼저 만들고 보컬·반주로 렌더링하는 음악 생성 모델 공개System76, GPU 메모리 최대 192GB의 Thelio Mira AI 리눅스 워크스테이션 공개NTSB, 마이애미 767 활주로 이탈 사고서 158노트 접지 뒤 4초 만의 복행 중단 기록 공개라즈베리 파이 카메라가 pHash 서명을 이미지 워터마크에 숨겨 압축 뒤에도 촬영 증명을 남기는 오픈소스 프로젝트멕시코 16세 학생, 30Hz 음파로 촛불을 5-8초 만에 끈다는 소화기 제작Astra에 40억 토큰과 35시간을 맡긴 개발자, "가치 있는 결과물은 없었다"WebGPU 무한 셰이더가 macOS WindowServer를 멈춰 강제 재시작 유발Anthropic, 8개월간 Claude 악용 7개 분야 차단 사례 공개OpenAI, Codex 하네스를 세션·오케스트레이션·샌드박스까지 관리하는 Agents API로 공개OpenAI, 나비에-스토크스 166쪽 증명과 Lean 4 형식 증명 함께 공개더글러스 호프스태터 스탠퍼드 강연, 유추를 인지와 범주화의 중심으로 설명Forgejo 16.0.3 이하, 악성 템플릿으로 호스트 데이터 탈취·원격 코드 실행 가능보고서: 미 국방·정보기관의 공개 기술기업 계약 상한, 2019-2022년 최소 $530억로버트 허친슨의 무료 온라인 음악 이론 교재, 현대성·표기법·범위 놓고 HN 토론NASA 위성영상 색상 알고리즘, 앙코르와트의 희미한 벽화 약 200점 발견에 사용10년 묵은 케이블 두 개를 찾은 뒤, 가족 케이블 상자에 '버리지 말라'는 글을 붙인 개발자Magic, 공개 베이스 모델 대비 사전학습 FLOPs 효율 10배 이상 주장NASA 위성영상 색 보정 기법, DStretch로 희미한 고대 암각화 드러내PlanetScale, 실제 PostgreSQL 샤드와 라우터로 구성한 Neki 플랫폼 프리뷰 공개소프트웨어의 숨은 변경 비용과 끝없는 선택지가 조직을 과열시킨다는 주장Cognition, Kimi K3 후학습 SWE-2 공개… FrontierCode 50.0%, Fable 5.1보다 64% 저렴 주장히타치, 태양광 잉여 전력용 주간 요금제 대응 CO2 히트펌프 급탕기 출시소니, 플레이스테이션 디지털 게임의 '구매' 표기와 취소 가능한 라이선스를 둘러싼 캘리포니아 소송수학자 Thom, OpenAI의 비공개 수학 대화 데이터 처리 설명에 신뢰 문제 제기마이크로소프트, Rust를 내부 Tier-1 언어로 지정하고 MSVC용 rustc 코드생성 백엔드 운용Shopify, 코딩 에이전트 비용 변화로 React Native에서 Swift·Kotlin 네이티브로 전환아드먼, 창립 50주년 맞아 월리스와 그로밋 원본 인형 등 약 250점 경매스톡피시 19, 18 대비 최대 44 Elo 상승하고 범용 CPU 바이너리로 전환메타를 떠난 IT 종사자, 인터넷이 연결보다 관리 부담과 착취가 됐다고 비판개인 개발자가 8× B200으로 3.8B LLM을 43시간·998달러에 학습해 CORE 0.384 기록미국 스트리밍 9종 묶음, 2021년 3월 대비 월 61% 올라 연 $702 증가유리수 전처리로 9차 다항식 평가를 곱셈 8회에서 5회로 줄인 인터랙티브 데모Windows XP의 첫 사용자 그림, GetTickCount 시드와 리저버 샘플링으로 골랐다테런스 타오: 목표만 푸는 AI가 수학의 우회와 탐색을 지울 수 있다DeepSeek, 552B MoE V4.1-Flash 출시하고 V4-Pro 요청을 새 모델로 전환 예정리비안, 프레임 간 객체 추적으로 완전자율주행 겨냥하고 월 49.99달러 책정UN, 메르카토르 대신 등적 Equal Earth 지도 권고안 164 대 1로 채택Cognition, Devin으로 GPU GNFS 구현해 RSA-260 인수분해. RSA-1024 비용 약 $3천만 추정정적 타입 언어 Bespoke, 컴파일러에 정중한 문장으로 요청해야 코드가 되는 풍자Planet Labs 공개 궤도 데이터와 DuckDB로 97기 위성군을 추적한 재현 가능한 분석블리자드 직원 1,900명, AI 대체 사전협의·해고 후 14개월 재고용권 담은 노조 계약 비준광속을 시속 5km로 낮춘 가상 공원에서 상대론 효과를 직접 조작하는 Show HNAutomattic 이사회, 매트 뮬런웨그를 유급 휴직 처리하고 CFO를 임시 CEO로 선임Read the Docs, 분당 550만 요청 DDoS에 캐시 미스 404·302 집중 공격Qwen3.8, GPT-5.5 Pro 추론 1% 접두사에 답변 중복률 18.18%p 상승IEEE Spectrum 자율주행 안전 기사 본문 누락, HN은 ADAS 과신과 안전 검증 기준을 논쟁Anthropic, AI 성능·채택률로 2030년 미국 GDP·고용을 계산하는 경제 시나리오 공개GNU Radio DSP와 Qt GUI를 WebAssembly로 컴파일해 브라우저에서 SDR 플로우그래프 실행Apple Watch Series 12, 고빈도 HRV 측정과 준비도 점수 도입애플, 가변 조리개 48MP 카메라와 A20 Pro 탑재 iPhone 18 Pro 공개No Man's Sky 7.0 'Cosmos', 우주 정거장 운영·연합·심우주 인양 추가비자와 마스터카드는 카드 발급사가 아니라 승인·정산·분쟁 규칙을 운영하는 결제망GPT-6 Astra의 루프드 트랜스포머, CoT를 감추는 구조인가애플, 오픈형 ANC를 강화한 AirPods 5를 $129에 발표애플 첫 폴더블 iPhone Duo 공개, 10월 16일 예약 시작하고 $1,999부터 판매클라우드플레어 초기 구조를 설계한 공동창업자 리 할로웨이의 전기 1부뉴요커의 1990년 풍자 법정문: 와일 E. 코요테가 Acme에 85건의 제품 책임 소송 제기Lotus Notes: 1989년 이메일 기능보다 먼저 복제형 협업 데이터베이스를 만든 플랫폼OpenAI, GPT-5.6 Sol로 6큐비트 칩 보정 측정 자동 실행 사례 공개OpenAI, 1만 AI 에이전트로 나비에-스토크스 반례 주장…연구자 공로·사용 데이터 논란데저트 앤트, iPhone에서 300배 실시간 전사 내세운 온디바이스 모델 18종 공개구글 광고가 RACE를 악성 소프트웨어로 정지시켰다가 HN 노출 뒤 복구딥시크, V4.1 Flash 출시 뒤 Pro 요청까지 Flash 요금으로 전환 예고Tailwind Labs, Shopify 합류하고 Tailwind Plus 신규 가입 중단"장바구니에 담기" 버튼만 파랗게 바꾸라며 Claude의 과잉 작업을 풍자한 체험 사이트빈 프롬프트가 가리는 AI 활용 가능성, 저자는 이를 발견 문제로 규정조슈아 갠스, AI를 '예측의 가격'으로 보는 미시경제학 오픈 액세스 책 출간10명 에이전트가 모노레포 계획 파일을 블랙보드처럼 써 항공 운항 장애 시스템을 4일 만에 구현미 법원, X의 TWITTER 표장은 유지하되 TWEET·새 로고는 포기 가능성 인정27.5KB WebGPU 모델로 문법 없이 75개 언어 소스에 하이라이트주곡률 해칭과 숨은선 처리를 조절하며 위상 곡면을 판화처럼 그리는 인터랙티브 웹 앱나무는 중력·빛 없이도 줄기 휨을 감지해 장력목으로 스스로 곧게 편다Plush 인터프리터, Rust enum을 64비트 태그 값으로 바꿔 17% 가속GrapheneOS의 저작권 폐지 주장에 HN, GPL 보호와 보호기간 단축을 두고 충돌OpenAI, 생성 지연 최대 50% 줄인 ChatGPT Images 2.5 발표ICML 논문: LLM은 무작위 결과를 반복 학습하며 가상 집단에도 새 사회적 편향을 만든다Inception, 초당 1,107토큰·260K 컨텍스트의 확산 LLM Mercury 2.5 출시브라우저에서 6억 파라미터 LLM의 토큰별 어텐션 합산값을 즉시 시각화하는 데모