卡帕西谈提升 AI 回答质量:少抠提示词,多用语音把想法讲透
据 IT之家 7 月 25 日消息,知名 AI 研究员、“氛围编程”概念提出者安德烈·卡帕西近日分享了一个提升 AI 回答质量的使用方法:与其反复打磨提示词,不如直接打开语音模式,把脑中的想法连续讲出来。他表示,自己有时会对着 AI 讲大约 10 分钟,内容不必完整,也不需要提前组织,甚至可以非常混乱。核心在于让大语言模型获得足够多的上下文,从而更准确理解用户真正想完成什么。
这番观点出现的时间点也很值得关注。来源显示,硅谷多家 AI 企业正在加速改进语音交互能力,试图让用户从键盘输入转向更自然的开口交流。OpenAI 本月早些时候推出了 GPT-Live,为 ChatGPT 语音功能提供支持;Anthropic 本周四也升级了语音模型,允许用户选择 Opus、Sonnet 或 Haiku。AI 产品的竞争,正在从“谁的模型更强”进一步扩展到“谁能更好理解人的真实意图”。
卡帕西的方法:把“提示词工程”变成“上下文倾倒”
过去一年,很多用户使用 AI 时会花大量时间研究提示词模板:角色设定、任务目标、输出格式、限制条件、示例文本……这些方法确实有价值,但也带来了新的门槛。卡帕西的建议则更接近日常工作流:先别急着把问题写得完美,而是尽可能把背景、想法、困惑和目标都说出来。
他认为,有时大语言模型并不是“不会回答”,而是缺少足够信息来判断用户真正需要什么。用户脑中的项目目标、隐含限制、个人偏好、已有方案和犹豫点,如果只浓缩成一句提示词,很容易丢失关键上下文。通过语音连续表达,AI 可以获得更大的信息面,再把这些零散内容整理成有结构的计划、文档或行动清单。
按照卡帕西的做法,他通常会在开头提醒聊天机器人:自己的思路可能比较乱,语音转写也可能出现错别字。这个提醒看似简单,但实际是在给模型设定一种处理预期:不要逐字机械理解,而要在混乱输入中提炼意图、修正可能的转写误差,并主动建立结构。
为什么“闲聊 10 分钟”可能比精修一句提示更有效
对大语言模型来说,提示词本质上是任务说明和上下文载体。很多时候,用户以为自己给出了清楚的需求,但在模型看来仍然缺少背景。例如写一份产品方案,用户可能没有说明目标人群、现有资源、预算约束、偏好的语气、要避开的方向;做代码辅助时,也可能没有交代项目结构、历史决策和真正想解决的瓶颈。
语音漫谈的价值在于降低表达成本。相比键盘输入,人更容易在说话时补充细节、暴露犹豫、解释动机。AI 则可以承担后半段工作:把混乱想法转成条理化内容。对于中文用户来说,这种方式尤其适合头脑风暴、方案梳理、写作提纲、产品需求整理、学习计划制定等场景。
- 输入门槛更低:不需要先学复杂提示词模板,想到什么先说出来。
- 上下文更充分:模型能获得更多背景信息,减少误解任务目标的概率。
- 分工更清晰:人负责提供真实意图和原始材料,AI 负责归纳、整理和改写。
- 更适合早期创意:当想法尚未成形时,语音比结构化文本更容易承载发散思考。
影响解读:AI 交互正在从“写命令”走向“讲想法”
卡帕西的建议也折射出 AI 产品形态的变化。早期聊天机器人主要依赖文本框,用户需要像写需求文档一样描述任务;而随着语音识别、实时对话和多模态能力提升,AI 越来越像一个可以随时接收上下文的协作对象。未来的关键体验,可能不再是用户会不会写提示词,而是模型能不能听懂一段不完美的人类表达。
OpenAI 推出支持语音功能的 GPT-Live,以及带语音录制按键的迷你键盘;Anthropic 升级语音模型并开放不同模型选择,都说明厂商正在围绕“更自然的输入方式”布局。对 AI 工具行业而言,语音不是简单替代键盘,而是把用户的碎片化想法、现场讨论和即时决策直接接入智能体流程。
当然,这种方法并不意味着提示词技巧完全失效。对于需要严格格式、精确约束或可复用流程的任务,结构化提示仍然重要。但在项目早期、需求不清或想法很多时,卡帕西式的长语音输入可能更高效。可以先“乱说一通”,再要求 AI 输出摘要、目标、待办事项、风险点和下一步问题,形成一轮更高质量的协作。
从更大的趋势看,AI 助手正在向“理解人”而不仅是“执行指令”演进。当模型能够处理混乱、口语化、带噪声的输入时,AI 才更接近真正融入日常工作流。卡帕西的经验提醒用户:提高 AI 回答质量的第一步,未必是写出完美提示词,而是把足够多的真实上下文交给模型。