独立公开 VOC 研究 CASE FILE 04 · 2026.08

当 AI 不再
只有一个

我原本想研究哪个 AI 更受欢迎。
120 条公开网络语料让我换了一个问题。

最初的问题用户最终会选择哪个 AI?↓ REFRAME真正的问题用户如何为不同任务建立自己的 AI 路由?
RESEARCHER蔺昱夏定义问题 · 建立证据 · 挑战结论
120公开网络语料
105独立页面
13平台类型
43 / 77中文 / 英文
110包含具体使用行为

01 / SAMPLE COCKPIT

先看样本,
再谈结论。

这不是一项代表性抽样。它的价值在于发现重复行为、矛盾和可验证的产品假设。
来源结构N = 120
  • Reddit 74
  • App Store CN 17
  • V2EX 8
  • 其他10类平台 21

偏差提示:高频、付费和技术敏感用户占比较高,不能外推总体市场比例。

任务出现频次MULTI-CODED
工作流94
写作65
实时研究39
代码37
多模态19

工作流不是单一任务,而是用户跨产品搬运输入、结果和上下文的过程。

信任如何发生BEHAVIOR
107条报告验证*
  • 人工判断 89
  • 专业核对 23
  • 来源检查 16
  • 跨模型复核 11

* 120 条中仅 13 条未报告验证;这是样本特征,不代表总体比例。

V1.1 定向补样+40

不为了把数字做大,而是主动寻找原样本缺少的工作角色与反例。

营销 / 内容10
产品 / UX / 研究16
小企业 / 销售 / 自由职业7
中文主流产品用户4
跨职能重度用户3

02B / PATTERN LENS

换一个视角,结论就会改变

不要急着下结论。
先选择观察镜头。

RESEARCH QUESTION

用户是在比较模型,还是在设计一条任务路线?

54任务触发明确因任务差异切换
94工作流涉及跨工具协作
37代码依赖执行与测试
65写作依赖风格与上下文
PATTERN任务分工
ANALYTIC MEMO

成熟用户没有等待一个全能冠军。他们按任务、风险和现有上下文,把不同模型编进同一条工作流。

02 / RESEARCH SPINE

每条洞察,
都能沿证据链返回。

01原始反馈

保存来源与短引文

02行为编码

任务 · 驱动 · 触发

03模式聚类

找重复也找矛盾

04洞察判断

标置信心与边界

05产品下注

转成可验证假设

研究问题

用户为什么在多个 AI 之间切换、固化分工或停止切换?

纳入标准

必须包含真实任务、使用动作、判断或结果;纯榜单与宣传不入样。

分析单位

一条反馈是一段可独立编码的行为证据;同页多评论分别记录。

结论边界

探索性公开 VOC,只支持发现模式和提出假设,不估计市场比例。

03 / ANALYSIS WORKBENCH

一条证据,
不是一句金句。

点选三份公开材料,看我如何从原话走到编码、分析备忘与待验证判断。
RAW EVIDENCE · Reddit产品经理查看原始来源 ↗
I do fact check pretty often

这位产品经理把研究、原型、文案和访谈笔记交给不同工具,但发现研究链接经常与结论无关。

OPEN CODINGJOB · 研究 / 原型TRIGGER · 任务差异VERIFY · 来源核验OUTCOME · 加速但不托管
ANALYTIC MEMO / 蔺昱夏

这里的关键不是“AI 不可信”,而是同一个人会对不同任务采用不同信任阈值。信任单位应从品牌下沉到任务风险。

不是复述原话,而是解释行为机制。
竞争解释

也可能只是 Gemini 的链接质量问题,而不是普遍的风险分级行为。

产品判断

把产品机会从“推荐最强模型”改写成“按风险配置验证路径”。

04 / EVIDENCE ARCHIVE

不要只相信
我的总结。

从 120 条公开语料底稿中策展 18 条代表性材料,默认展示 9 条。这里是阅读入口,不是全部语料。
18精选证据池
120完整研究底稿
打开独立证据库 ↗
VOC-010Hacker News
constantly copy-pasting prompts

频繁跨平台复制提示词和比较回答,最终催生统一多模型界面。

VOC-011Hacker News
lose all context

切换产品会丢失偏好、项目和历史对话,用户开始构建可携带记忆层。

VOC-018App Store CN
处处纠错太累了

模型反复遗漏明确要求,首稿看似更快,最终却把时间花在持续纠错上。

VOC-029Reddit
spend another 30 minutes verifying

生成答案之后还要手工搜索多个来源,核验成本最终触发产品切换。

VOC-032Reddit
get another AI to finish

额度在任务完成前耗尽;换模型后还要重新审阅工作、恢复上下文。

VOC-040V2EX
反反复复改了一天

从零开发产品时,反复沟通和幻觉造成返工,用户让两个模型互查方案。

VOC-045V2EX
手动改了一部分代码

开发后期形成编码与调试分工;额度耗尽后切换模型,再由人工完成收尾。

VOC-067App Store CN
一个任务出现错误,连改都改不了

任务出错后积分耗尽,用户无法继续修正,额度机制直接阻断任务闭环。

VOC-072Reddit
fact check pretty often

原型、文案、研究和访谈笔记被交给不同工具,研究链接仍需频繁事实核验。

证据来自公开社区、应用商店与工作复盘;页面不把它描述为本项目招募的访谈,也不把网络样本当作总体比例。

05 / FIVE SIGNALS

洞察不是金句,
是证据与决策之间的桥。

0154条由任务差异触发

用户不是在选冠军,而是在排兵布阵

right model for the job

写作、研究、代码、快速问答和情绪交流被交给不同产品。所谓“最好”,往往只是省略了任务条件。

0228条涉及价格或额度

主力产品,不一定是最强产品

forced into 5 seats

更强但受限的产品被留给复杂任务;便宜、免费或入口方便的产品承担高频日常工作。

03107条报告了某种验证

信任发生在任务层,不发生在品牌层

researcher should research

用户可能信任一个产品写初稿,却不会直接采用它的事实、财务结论、研究建议或可执行代码。

0427条提到上下文与记忆

上下文正在成为新的迁移成本

one place where all the product context sits

切换时损失的不只是聊天记录,还有项目背景、表达偏好、历史取舍和重新被理解的时间。

0589条最终依赖人工判断

首稿速度,不等于完成速度

read every line

纠错、核验、跨模型复核和重建上下文反复出现,生成时间只是完整成本的一小部分。

06 / CLAIM AUDIT

让结论接受
反方追问。

点击命题,查看支持证据、竞争解释和下一轮验证设计。
CONFIDENCEHIGH

模型切换主要由任务差异,而非品牌偏好驱动吗?

支持证据

写作、研究、代码与多模态任务反复出现稳定分工;营销、产品、自由职业样本均有复现。

竞争解释

新鲜感、订阅轮换和模型版本变化也会制造看似“任务路由”的行为。

07 / RESEARCH LOG

这项研究里,
我推翻了自己三次。

01
我以为用户想找到最强的一个 AI
后来发现成熟用户更关心稳定分工,甚至主动避免频繁切换。被 54 条任务触发证据推翻
02
我以为免费只是获客手段
后来发现额度和席位会直接改变模型在工作流中的角色。被 28 条成本信号修正
03
我以为答案越快,体验越好
后来发现真正的效率是从提问到“敢于采用”的总时间。被 89 条人工判断行为改写

08 / THE HIDDEN JOURNEY

一次切换,
到底发生了什么?

01

开始任务

习惯或默认入口

02

第一次失败

遗漏、幻觉、风格偏离

03

继续纠正

投入已有上下文

04

触发切换

额度、失信或重复返工

SWITCH
05

迁移上下文

复制提示词、重讲背景

06

重新验证

来源、测试或第二模型

07

采用结果

由人承担最终判断

传统效率指标首字速度本研究建议达到可采用结果的总时间

09 / CONTRADICTION MATRIX

不是所有用户都同意,
才真正值得研究。

主题用户想要同时担心需要验证的问题
速度 秒回、立刻推进 太快意味着没有思考 不同风险任务的最佳等待感是否不同?
记忆 越用越懂我 换产品等于重新开始 怎样让记忆产生粘性但不制造锁定?
全能 一个入口完成所有事 专业任务仍需专门工具 默认入口应该全能,还是善于路由?
效率 几分钟得到第一稿 核验返工花回时间 什么指标能反映真正的任务完成?

10 / INTERACTIVE PROTOTYPE

把洞察变成
一条可执行路线。

探索性原型,不是经过大样本验证的推荐系统。
01. 你要完成什么?
02. 出错的影响?

ROUTE / RESEARCH / RISK MEDIUM

来源优先型路线

检索型 AI → 原始来源 → 第二模型挑战
  1. 01建立信息地图,不急着下结论
  2. 02打开关键来源,核验数字与语境
  3. 03高风险结论用第二模型寻找反例

11 / PRODUCT BETS

如果继续做,
我会先验证这三件事。

BET 01

任务路由器

先识别目标、风险、时效和输出标准,再建议工作路径,而不是宣布某个模型最好。

原型
任务诊断 + 路由解释
指标
总完成时间 / 中途切换率
BET 02

可携带上下文包

把目标、已确认事实、历史取舍和未解决问题压缩为可以交给另一个模型的项目状态。

原型
一键生成接力卡
指标
重讲背景时间 / 恢复成功率
BET 03

风险自适应验证

低风险任务减少打扰,高风险任务主动展示来源、反例、测试和人工确认节点。

原型
任务风险分级
指标
错误采纳率 / 验证成本