方法论

平台上每一个派生数的口径都写在这里:热度怎么算、学科基准怎么跑、Auto 按什么选模型。这一页的每一句都应当能对着数据或代码核对;核对不上的地方,欢迎指出来。

热度与排行

它是什么

热度是调用量的相对值,不是质量评分。它回答「最近有多少人在用它」, 不回答「它答得好不好」——后者见下面的「学科基准」。

口径

  • 统计窗口:24 小时 / 7 天 / 30 天三档,页面上切换的只是查询参数。
  • 计数单位是成功完成的请求。失败、被限频、被熔断跳过的不计入。
  • 同一用户的重复调用照常计入:热度衡量的是使用量,不是用户数。
  • 排行只包含当前可用的模型。下架与维护中的模型不参与排序, 也不会因为历史调用量高而留在榜上。

我们不做的事

  • 不按厂商加权,也不接受任何形式的排名付费。
  • 不把热度混进 Auto 的质量分。规则版 Auto 的「均衡」一档曾经按热度选模型—— 那是一个没有质量数据时的权宜,语义版上线后它被按领域的质量预测取代。

Auto 怎么选模型

三步

  1. 抽信号。 从你这条消息里判断:属于哪个科研领域、要做的是哪类任务 (问答 / 讲解 / 推导 / 计算 / 写代码 / 找文献 / 抽取 / 写作 / 数据解读)、 复杂程度、语言,以及这次必须具备的能力(看图、调用工具、结构化输出、上下文长度)。
  2. 过硬约束。 必需能力、你设的价位上限、你排除掉的模型、当前可用的接口—— 不满足的直接出局。这一步不打分,只筛。
  3. 打分排序。 在剩下的候选里,按「该领域该任务的质量预测 × 你的倾向权重 + 实时速度 + 相对价格」排序,取第一。

你的偏好是倾向,不是命令

「质量优先 / 均衡 / 速度优先 / 成本优先」改的是上面那三项的权重。 平台可以在有理由时不满足某一项偏好,但必须在回答里说明是哪一项、为什么—— 默默忽略一个你设过的选项,比不提供那个选项更糟。

每条回答都写明是谁、为什么

Auto 选完之后,回答的第一行就是选了谁和一句理由,展开可以看到: 判出来的领域与任务(含置信度)、排在后面的候选与它们的分数、 以及这次有没有降级(信号超时、预算用尽等)。

理由由模板从信号与分数生成,不由模型自己写——它要能对着日志核对。

显式指定优先

你在对话里明确指定了领域,就以你说的为准;语义信号只用来填你没说的那部分。 两者不一致时,界面会把这件事告诉你——你觉得回答不对路,很可能就是因为领域指错了。

我们不做的事

  • 不在开始输出之后换模型。 换了要重复计费,而你看到的答案会突然换一种口吻。
  • 不把你的对话原文发给第三方做分类。 用于判断领域的内部调用只允许打到 承诺不用于训练、且不跨境的供应商。
  • 不按厂商倾斜。 打分用的质量分公开在上面的「学科基准」一章里,规则就是那一份。

请验证你的身份

为了保护你的账户,这个操作需要再验证一次。

验证码已发送到你绑定的手机号。5 分钟内的其他敏感操作不会再问。

Cookie 偏好

您可以随时回到这里修改。页脚有常驻入口。

必要

维持登录状态、记住主题与语言偏好。没有它们本站无法正常工作,因此无法关闭。

统计

了解哪些功能有人用、用户在哪一步流失。只收集维度(页面、操作类型、计数),不收集您输入的任何内容。

本站不加载任何第三方统计脚本,也不做会话录屏。完整说明