본문으로 건너뛰기
tokenblackhole.

2026-09-20 수정

Openference : 10분 39초 기다리고 에러를 받았다. 이건 준 사기다

thinking만 10분 39초 돌고 "The model provider's stream was interrupted" 로 끝났다. 돈은 냈고 결과는 0이다. 앞에서 잰 85초짜리 지연은 느린게 아니라 예고편이었다.

10분 39초

GLM 5.3 Flash 로 요청 하나를 던졌다. 화면에 뜬건 이거다.

Thought: 10m 39s

Error: The model provider's stream was interrupted.
Please retry.

10분 39초 동안 thinking 만 돌고 스트림이 끊겼다. 결과가 안 나왔다. 돈은 나갔고 받은건 없다. "다시 시도하세요"가 답이면 그 10분은 뭐가 되냐.

한 번이면 그럴 수 있다고 넘긴다. 근데 아래에서 잰 것들이 전부 같은 방향을 가리킨다. 이건 운이 아니라 패턴이다.

앞에서 잰 것들

reasoningeffort=low, maxtokens=400 으로 스트리밍. 본문 40줄 쓰라고 했다.

GLM-5.3-Flash            85.3s   4294 tok   ~50 tps
  thinking 14,616자 -> 본문 3,108자

GLM-5.3                  57.3s   5021 tok   ~88 tps
  같은 패턴

DeepSeek-V4-Flash-0731   19.7s   1468 tok   ~75 tps
  본문이 훨씬 빨리 시작 (같은 키)

Flash 한테 40줄 쓰라고 했는데 thinking 1.4만 자를 먼저 쏟고 나서야 본문이 나온다. 디코드 자체는 초당 50토큰 근처라 완전 죽은 속도는 아니다. 근데 화면에는 아무것도 안 나오고, 이번엔 본문이 아예 안 나왔다.

실제 세션은 더 심하다

  • 기본 thinking 이 max 다. config.yml 에 openference/glm-5.3-flash:max 로 들어간다.
  • 그리고 thinking 블록을 숨긴다.
  • 한 마디 물어보면 입력 18,285토큰, TTFT 9.6초, 출력 67토큰 중 reasoning 58토큰.
  • 마리오 1-1 요청은 97초 동안 화면에 본문이 0이었다. thinking 만 길게 돌다가 abort.
  • 그리고 10분 39초 후에 스트림 인터럽트.

사기냐

지갑을 털어가는 사기는 아니다. 모델도 진짜고 디코드도 정상이다. 근데 준 사기다. 돈은 받고, 시간은 다 먹고, 결과는 안 준다. 돈 낸 사람 입장에서 그 셋이 뭘 뜻하는지는 설명이 필요 없다.

"느린 것뿐"이라고 부르기엔 결과가 안 나온다. 느린건 참으면 되는데 0은 참아도 0이다.

그래서 어떻게 쓰나

  • 일단 이 섹션에 올린 이유다. 경고할 만하다고 봤다.
  • 굳이 쓸거면 thinking 을 low 로 내린다. max 로 두면 위처럼 된다.
  • 아니면 같은 키에서 DeepSeek-V4-Flash-0731. 19.7초 대 85.3초고, 적어도 안 죽는다.
  • 결과가 안 나온 요청이 환불되는지는 확인해봐야 한다. 10분 39초는 공짜가 아니다.

모델은 나쁘지 않다. 운영이 나쁘다. 그리고 돈 내고 사는건 모델이 아니라 운영이다.