2026-09-20 更新
Openference:等了 10 分钟,然后收到一个报错。我认为这算半个骗局
thinking 跑了 10 分 39 秒,请求以「The model provider's stream was interrupted」结束。钱付了,什么都没拿到。之前量到的 85 秒不是慢,是预告。
10 分 39 秒
用 GLM 5.3 Flash 发了一个请求。屏幕上出来的是这个。
Thought: 10m 39s
Error: The model provider's stream was interrupted.
Please retry.thinking 转了 10 分 39 秒,然后流断了。没有结果。钱出去了,什么都没回来。如果答案是「请重试」,那这十分钟算什么。
一次可以说是运气。但下面量到的所有东西都指向同一个方向。这是模式,不是意外。
在那之前量到的
reasoningeffort=low、maxtokens=400 流式跑,要求写 40 行正文。
GLM-5.3-Flash 85.3s 4294 tok ~50 tps
thinking 14,616 字 -> 正文 3,108 字
GLM-5.3 57.3s 5021 tok ~88 tps
同样的模式
DeepSeek-V4-Flash-0731 19.7s 1468 tok ~75 tps
正文开始得快得多(同一个 key)让 Flash 写四十行正文,它先倒了 1.4 万个字符的 thinking,正文才开始。解码本身每秒五十 token 左右,速度并没有死。但屏幕上一个字都不给你看 —— 而这一次,正文干脆没来。
真实会话更糟
- 默认 thinking 是 max。config.yml 里写的是 openference/glm-5.3-flash:max。
- 而且 thinking 块是隐藏的。
- 问一句话:输入 18,285 token,TTFT 9.6 秒,输出 67 token 里 reasoning 占了 58。
- 一个马里奥 1-1 的请求跑了 97 秒,屏幕上正文是 0。thinking 一直转,然后我 abort 了。
- 然后在 10 分 39 秒之后,流被中断。
算不算骗局
不是掏空钱包那种。模型是真的,解码速度也正常。但它算半个骗局:钱收了,时间全吃掉,结果不给。对一个付了钱的人来说,这三件事意味着什么不需要解释。
说成「只是慢」在「什么都没返回」面前站不住。慢可以等,零等多久都是零。
那该怎么用
- 这就是它出现在骗局预警而不是评测里的原因。它值得一个警告。
- 一定要用的话,把 thinking 降到 low。留在 max 就是上面的结果。
- 否则用同一个 key 上的 DeepSeek-V4-Flash-0731。19.7 秒对 85.3 秒,至少它不会死。
- 值得确认一下没返回结果的请求能不能退款。10 分 39 秒不是免费的。
模型不差。运营差。而你花钱买的是运营,不是模型。