跳到正文
tokenblackhole.

2026-09-20 更新

Openference:等了 10 分钟,然后收到一个报错。我认为这算半个骗局

thinking 跑了 10 分 39 秒,请求以「The model provider's stream was interrupted」结束。钱付了,什么都没拿到。之前量到的 85 秒不是慢,是预告。

10 分 39 秒

用 GLM 5.3 Flash 发了一个请求。屏幕上出来的是这个。

Thought: 10m 39s

Error: The model provider's stream was interrupted.
Please retry.

thinking 转了 10 分 39 秒,然后流断了。没有结果。钱出去了,什么都没回来。如果答案是「请重试」,那这十分钟算什么。

一次可以说是运气。但下面量到的所有东西都指向同一个方向。这是模式,不是意外。

在那之前量到的

reasoningeffort=low、maxtokens=400 流式跑,要求写 40 行正文。

GLM-5.3-Flash            85.3s   4294 tok   ~50 tps
  thinking 14,616 字 -> 正文 3,108 字

GLM-5.3                  57.3s   5021 tok   ~88 tps
  同样的模式

DeepSeek-V4-Flash-0731   19.7s   1468 tok   ~75 tps
  正文开始得快得多(同一个 key)

让 Flash 写四十行正文,它先倒了 1.4 万个字符的 thinking,正文才开始。解码本身每秒五十 token 左右,速度并没有死。但屏幕上一个字都不给你看 —— 而这一次,正文干脆没来。

真实会话更糟

  • 默认 thinking 是 max。config.yml 里写的是 openference/glm-5.3-flash:max。
  • 而且 thinking 块是隐藏的。
  • 问一句话:输入 18,285 token,TTFT 9.6 秒,输出 67 token 里 reasoning 占了 58。
  • 一个马里奥 1-1 的请求跑了 97 秒,屏幕上正文是 0。thinking 一直转,然后我 abort 了。
  • 然后在 10 分 39 秒之后,流被中断。

算不算骗局

不是掏空钱包那种。模型是真的,解码速度也正常。但它算半个骗局:钱收了,时间全吃掉,结果不给。对一个付了钱的人来说,这三件事意味着什么不需要解释。

说成「只是慢」在「什么都没返回」面前站不住。慢可以等,零等多久都是零。

那该怎么用

  • 这就是它出现在骗局预警而不是评测里的原因。它值得一个警告。
  • 一定要用的话,把 thinking 降到 low。留在 max 就是上面的结果。
  • 否则用同一个 key 上的 DeepSeek-V4-Flash-0731。19.7 秒对 85.3 秒,至少它不会死。
  • 值得确认一下没返回结果的请求能不能退款。10 分 39 秒不是免费的。

模型不差。运营差。而你花钱买的是运营,不是模型。