같은 오픈 모델도 OpenRouter 공급자에 따라 도구 호출 점수가 20점 넘게 갈렸다
- iMessage AI 비서 Olly 운영자는 누적 1,800만 메시지 중 약 3분의 1을 OpenRouter 경유 오픈 모델로 처리하며 공급자별 장애 사례를 수집했음
- 동일한 DeepSeek V4 Flash 0731 가중치라도 32일 평균에서 DeepSeek 1차 공급자는 GPQA 90.2%, TAU-Bench 81.3%였지만 DigitalOcean은 75.3%, 58.4%로 도구 호출 점수가 20점 이상 차이 남
- 이미지 입력 시험에서 DeepInfra의 Qwen3.5 122B 엔드포인트는 K를 R이나 I로 읽고 빨강을 파랑이라 답했으며, Venice와 Together의 MiniMax M3 엔드포인트는 이미지를 받지 못했는데도 200 OK를 반환함
- 모든 공급자가 reasoning.effort 값을 받지만 DeepSeek V4 Flash 0731의 low·high·max 반복 시험에서 DigitalOcean, GMICloud, Mancer, Venice 등은 추론 토큰 수가 설정에 따라 달라지지 않았음
- 공급자가 선언한 FP4·FP8 양자화 필터는 품질 보증 수단이 아니었으며, FP4 공급자와 FP8 공급자 모두 GPQA 점수가 크게 갈리고 일부 공급자는 70% 수준에 머묾
Hacker News opinions
이거 보고 나니 너무 끔찍한데, 대안이 뭐임?
난 opencode go와 opencode work는 안정적으로 썼음. 다만 DeepSeek 접근을 막으면서 중국으로 데이터가 간다는 데 동의하라고 한 뒤로, 이전 데이터 처리도 믿기 어려워졌고 DeepSeek 가격도 많이 올랐음.
난 Vercel AI Gateway를 써봤음. 모델 목록은 에 있음.
이 문제는 OpenRouter만의 문제가 아니라 LLM 서빙 전반의 문제임. 다른 메타 공급자도 비슷할 거고, 공급자와 직접 계약해도 품질과 기능 차이는 남음. 오픈 웨이트 모델 보급을 막는 가장 큰 문제 중 하나라고 봄.
난 그냥 한 공급자를 쓰겠음. 그러면 최고 품질 공급자를 고르고 집계 계층과 나머지 공급자 복잡성을 피할 수 있는데, 왜 굳이 벤더 중립성 때문에 작동하지 않는 구성을 택하는지 모르겠음.
오픈소스 모델만 필요하면 cline과 opencode가 일반 API용 종량제와 구독제를 제공함.
OpenRouter는 한 API로 모델을 빨리 시험하기엔 좋음. 하지만 운영에는 안 쓰겠고, 고른 뒤에는 보통 더 싼 1차 공급자로 직접 갈 것 같음. API 전환 비용도 거의 없고 기능 플래그로 둘 다 붙일 수 있음.
난 Requesty를 써봤는데 공급자를 고정하고 자체 라우팅 정책을 만들 수 있어서 결과를 어느 정도 예측할 수 있었음.
난 Merge AI Gateway를 쓰고 있는데 지금까진 괜찮았음. 새 모델을 빨리 추가하고 지원 응답도 빨랐음.
Fireworks는 모델을 직접 호스팅하니 글에서 말한 일관성 문제는 줄일 수 있을 듯함. 몇 달 전 비교했을 때 내가 잠깐 써본 선택지는 Fireworks와 OpenRouter였음.
인기 LLM 게이트웨이가 대형 공급망 공격을 당한 걸 보고 직접 만들었음. 2주 정도 걸렸고 moonshot, qwen, Gemini, zhipu, Anthropic, DeepSeek, OpenAI를 내부 표준 형식과 공급자별 어댑터로 연결함.
비용 얘기가 더 있었으면 했음. OpenRouter 크레딧은 생각보다 너무 빨리 닳더라.
데이터 수집 공급자를 피하려고 기본 공급자를 막아 설정했는데 이상한 동작을 봤음. 잘 검증된 공급자를 거르는 건 필요하고 OpenRouter에 그 기능은 있음.
그래도 글의 요지는 신뢰 공급자로 분류된 곳도 성능이 일관되지 않고, 모델마다 결과가 다르다는 거임.
나도 모델 시험하려고 OpenRouter에 $100 넣었음. 크레딧을 다 쓰고 모델을 고르면 당분간은 원래 공급자로 가는 게 맞겠다고 생각함.
엄격한 JSON 출력도 모든 엔드포인트에서 작동하지 않더라. 결국 하나씩 시험해서 통과한 곳만 허용 목록에 넣고 있음.
OpenClaw와 OpenRouter를 쓰다가 같은 프롬프트 결과가 너무 들쭉날쭉해서 그만뒀음. OpenClaw 문제인 줄 알았는데 공급자마다 차이가 난다는 건 생각도 못 했음.
내 API 키가 싱가포르에서 쓰였는데 일일 한도 $10인데도 $100이 빠져나갔음. 프런티어 모델도 전부 차단됐고, 국가나 IP 같은 키 제한도 없었던 것으로 보임.
난 반대 경험임. 한도를 설정하고 실제로 닿는 걸 नियमित적으로 확인하면서 의존하고 있음. 지원팀 분석이나 사후 보고가 있었는지 궁금함.
API 키 IP 제한은 이제 실제로 있음.