当AI开始“说话”,人类语言的深层意义会被改变吗?
2026-08-05 11:24 澎湃新闻
斯托克韦尔认为,“人类语言的深层结构源于‘湿件’(注:wetware,指代大脑与生物神经系统,与硬件、软件相对),即肾上腺素的激增、多巴胺带来的愉悦、对社会联系的渴望,这些真实的生理和情感体验在语言的结构和使用方式中得到体现。
目前,包括语音留言、旁白、播客等单一声音的输出上,AI可以做得很逼真,但是还无法稳定地掌握如何进行适当的定时呼吸,或者以人类犹豫的方式去犹豫,特别是在互动结构中自然地表现。
“AI现阶段不能理解,当我们感到兴奋、开始发火、恭敬地倾听老板讲话,或者训斥自己孩子、轮流说话时,说话节奏会如何变化,它也无法稳定地根据对方的声音调整自己的音量、语速、口音或音高。”哈达克说道。
她解释,鉴于声音部分受生理构造限制这一事实,目前最前沿的模型非常擅长合成特定的声音。但由于人类可选择的潜在词汇量非常庞大,AI 很容易在特定的语言特征,如称谓、礼貌程度或幽默感上偏离其目标风格。在缺乏某套特定语言习惯的知识时,AI会惯常地退回到其预先存在的刻板印象中,例如,恋人之间会使用亲昵的称呼,母亲只会说充满爱意和关怀的话。
在现实中,人类对话是一个时序极其精准、合作性极强,且在社会层面高度相互负责的系统。哈达克举例说,当人类交谈时,我们不断地监控自己和对方:我现在应该说话还是保持沉默?太长时间的沉默会被视为无礼吗?我应该发出一点表示赞同或同情的轻微声音吗?我应该伴随着支持性的叹息或感叹插入说话(重叠)吗?我应该纠正这个误解吗?等等。








