OpenAI, Decisions API 퍼블릭 베타 공개: gpt-6-luna로 분류·라우팅 10배 빠르게
- OpenAI가 Decisions API를 퍼블릭 베타로 공개함. 텍스트나 이미지를 평가해 조건 확률, 고정 선택지, 루브릭 점수를 돌려주며 Responses API보다 10배 빠르다고 OpenAI가 밝힘. 몇 주 안에 GA 예정.
- 현재 쓸 수 있는 모델은 gpt-6-luna 하나뿐이고 전용 POST /v1/decisions 엔드포인트로 호출함.
- 질문 유형은 세 가지임. predicate는 조건이 참일 확률 0~1, choice는 순서 없는 범주에서 하나를 고르고, score는 순서 있는 등급의 확률 가중 평균을 반환함.
- 요청은 model, input, questions로 구성됨. 각 질문에 고유 name을 붙이면 응답의 answers 배열에서 같은 이름으로 매칭되고, playground에서 코드 작성 전에 미리 실험 가능.
Hacker News opinions
OAI가 이걸 만드는 데 오래 안 걸렸네. 예전에 곧 나올 거라는 얘기가 돌았고 결국 맞았음. decisions voice도 꽤 흥미롭더라.
Jev랑 가격 비교하면 어떻게 됨?
입력 100만 토큰에 $0.10, Jev는 $0.042임. 출력은 둘 다 무료고. 오늘 OpenRouter로 같은 벤치 돌려보니 풀 Jev 런이 $0.0192, Luna가 $0.06이라 Jev가 3배쯤 유리하더라.
벤치마크 없으면 믿지 않음. 벤치마크나 내놔라.
이거 구독으로 쓸 수 있음?
안 됨. OpenAI 구독은 API 호출을 한 번도 커버한 적 없음. 구독으로 가장 가까운 건 Codex로 구조화 출력 받는 정도임.
이미지 입력은 이미 지원함. 내가 Jev에서 찾은 첫 번째 큰 구멍이었음.
빠르고 이미지도 이해하니 비디오 게임도 돌아갈까? EA FC용 LLM 하네스가 있는데 가장 빠른 LLM도 너무 느렸음. 이걸로 해봐야겠음.
문서 예제 중에 게임 플레이하는 게 있음. 복잡한 건 무리일 듯. 정확도를 속도와 맞바꾸는 거니까.
왜 OpenAI에 돈을 내는지 모르겠음. Jev 수준은 직접 돌리는 게 별로 어렵지도 않고 훨씬 싸다. moat가 정말 없어 보임.
직접 돌릴 이유가 뭐임? 100만 토큰에 $0.10인데, Jev는 더 싸고. VPS 임대하는 이유랑 같은 거임.
결과 품질에 달렸음. 결정 모델은 자체 eval을 돌려야 하고 일반 텍스트 출력처럼 대충 감으로 판단하기 어려움.
내 유스케이스는 월 $11 정도고 이미 OpenAI 키와 결제가 붙어 있음. 자체 모델 인프라 안 돌리고 다른 업체 계정 승인도 안 받아도 됨.
벤더 온보딩에 3~6개월 걸리는 회사면 이건 그냥 당연한 선택임. 모델 거버넌스까지 붙으면 더더욱.
결정 모델은 몇 주 뒤에 랩이 '개선했다'며 조용히 바꿔버리는 게 제일 걸림. 내 유스케이스에서는 그게 싫음.
모델 전환은 키 두 번이면 됨. 이보다 덜 스티키한 제품이 없음.
curl로 /v1/decisions에 predicate 두 개 물어보니 complaint 0.91, compliment 0.06이 나왔음. llm-openai-decisions 플러그인으로 만들었는데, OpenAI가 이렇게 엔드포인트를 정의하면 다른 제공자도 따라가는 사실상 표준이 됨.
Jev가 업계를 흔든 건 맞음. hindsight로 보면 당연해 보임.
근데 이건 아주 단순한 결정용임. 실제 문제는 구조화 출력과 하위 구조가 필요하고, 결정 API를 20번 따로 호출하면 20개 결정 사이의 일관성이 깨짐. 이 hype는 곧 잊힐 거임.
600콜이 안 되는 내 결정 eval(UI 컴포넌트 선택, 차트, 태그 선택)을 OpenRouter로 Jev, Mercury Decide와 돌려봤음. Jev보다 느리고 Mercury와 비슷한 지연이었음. p50 346ms, p95 860ms. 애매한 UI 컴포넌트 작업에서 Luna가 0.6 이하로 확신이 낮고 실패 호출도 4건(Jev, Mercury는 0건)이었고 평균 3.1배 더 비쌌음.