与经典的单模态语言理论不同,越来越多的研究支持语言是一个多模态系统。本研究以否定(人类认知和语法的核心组成部分)为切入点,为这一观点提供了神经认知层面的证据。研究采用脑电技术(EEG),考察了韵律与手势如何影响土耳其语中标准动词否定的加工。结果显示,手势减轻了动词否定加工中的认知负荷,而韵律仅在与手势同时出现时发挥作用。这些发现说明,语法否定依赖于多模态整合,支持手势参与语言语法编码的观点。
(🔗点击文章底部阅读原文获取原文和相关资源)
摘要
否定是人类认知和语法的基本组成部分,可通过不同模态表达。然而,关于否定的多模态加工,尤其是语法否定(如“I did not sleep”)的多模态加工,目前仍知之甚少;手势和韵律标记对其神经加工的贡献也尚不清楚。本研究以土耳其语为对象,考察多模态否定的神经认知机制;土耳其语为动词后置语言,其标准动词否定通过动词后的形态后缀(-mA)表达。值得注意的是,该否定后缀会将重音移至动词词干,偏离土耳其语默认的句末重音模式。在土耳其语中,标准动词否定还常伴随约定俗成的否定手势(后翻掌手势),且手势出现在否定后缀之前的动词词干上。由于手势与韵律标记均先于否定后缀出现,本研究采用脑电技术考察二者的出现是否以及如何影响动词后否定标记的加工。手势诱发了由其固有知觉突显性驱动的N100效应。手势还降低了对动词后否定后缀形成预期期间的N400振幅,表明否定手势在否定加工中具有促进作用。韵律同样增强了这种N400降低效应,但仅在手势存在时出现。这些发现表明,手势以及韵律降低了加工动词否定形态句法标记所涉及的认知负荷。总体而言,这些结果为多模态信息不仅支持语义加工,也支持语言核心语法操作提供了神经生理学证据。
引言
近年来,越来越多的证据表明,与经典单模态语言理论不同,语言的结构与加工本质上是多模态的。在这一背景下,否定是一个重要例证。否定是人类认知的一个核心方面,普遍编码于世界各语言的语法之中。命题逻辑中的否定只是简单地反转一个命题的真值,而自然语言中的否定则更为复杂:它具有多种形式,并在词汇/语法层面以及语义/语用层面与多样的语言功能相互作用。
否定最初是在文本与言语中研究的,但其多模态性质正日益得到认可。在面对面交流中,韵律和手势线索与否定表达共同出现,用以传达否认、拒绝与更正性言语行为。已有研究识别出一组特定的手部和非手部表达与否定系统性关联,如摇头、掌心向下手势和皱眉,且常伴随特征性语调模式。值得注意的是,这些线索在塑造否定的语义范围与语用解读方面起着关键作用。例如,Prieto等人(2013)发现,语调曲线与手动及非手动手势的组合对语用推理至关重要,尤其是在双重否定的解读中,这与关联理论的观点高度一致,即任何认知加工输入在特定时刻都可能具有关联性。同样,Harrison(2024)通过考察重音否定词、伴随的横向扫动手势和面部表情等多模态否定,识别出一种似乎与手势的形式和组织密切相关的声学模式。
然而,既往研究大多聚焦于否定词层面的语义组合以及言语行为层面的语用特征,尚未探讨这些特征如何在形态句法层面相互作用(尤其是在标准否定的语法编码中),也未考察其加工背后的神经认知机制。在这里,本研究旨在考察多模态否定的神经关联,重点关注韵律与手势的贡献。
伴随言语的手势已被证明主要在与语言相关的语义层面(而非语法层面)与神经加工发生相互作用。此外,否定手势在语言结构和加工中的作用受到的关注相对较少,而这类手势具有约定俗成性和文化特异性。韵律在语言加工中的神经认知相关性已在多种语言功能(包括语法加工)和多种语言中得到充分记录,土耳其语也不例外。然而,目前仍缺乏一个考察韵律与手势相互作用以支持否定的神经认知框架。
关于语法否定的类型学研究,主要考察带有动词谓语的陈述句,即标准否定,这也是本文的关注点。Dahl区分了两种类型:句法否定,其中否定标记是助词或助动词;以及形态否定,其中否定标记是词缀。否定通常出现较早,常位于动词之前,否定助词在各语序中均遵循这一模式。然而,形态否定略倾向于使用后缀,并且在动词后置或自由语序语言中更为常见。
土耳其语是一种动词后置的黏着语,其标准否定通过后缀-mA以形态方式标记,该后缀还带有独特的韵律。在土耳其语中,词层面的突显(下文称重音)通常落在末音节上,与形态复杂度无关。然而,否定后缀-mA表现为一种前移重音后缀,将重音移至其直接前一个音节(即本研究中的动词词干)(图1A和B)。土耳其语中的否定还常伴随一种约定俗成的手势——后翻掌手势(backward hand flip),它先于否定后缀出现(图1C)。
图1.韵律和手势概览。
跨语言来看,否定词常位于动词之前,这反映了Hawkins的在线加工最大化原则(MaOP)。按照Hawkins的观点,语法受语言加工需求的塑造,而MaOP原则的核心在于:通过选择和组织语言形式,使句法与语义表征能够被尽早通达,从而提高加工效率。在土耳其语中,否定后缀-mA位于动词之后,但先行的韵律和手势标记可能依据MaOP原则促进否定的加工。
土耳其语标准动词否定的韵律标记似乎已如其他许多黏着语素(包括附缀和助词)一样语法化,它在形态句法标记之前的词汇层面被编码,而非通过语调曲线的变化来表达;否定手势虽然可选,却在语料中普遍存在,约出现在85%的标准动词否定句子实例中。这就提出了一个重要的问题,即韵律与否定手势如何独立或共同地与否定后缀相互作用,进而影响否定的语法加工。本研究采用EEG考察了这一交互作用,通过事件相关电位(ERP)的振幅调制来揭示与这些标记相关的任何加工优势。
材料与方法
被试与刺激材料
本研究共招募24名标准土耳其语母语者(女18名,男6名;年龄20–31岁,M=26.3,SD=4.02)。刺激材料由120段土耳其语短对话组成,每段包含三个句子。第一句引入中性语境(不预示否定回答),第二句呈现一个是/否问题,对第三句中的关键词建立窄焦点(图2A)。关键刺激词为由附着于单音节动词词干的前置重音否定后缀-mA构成的否定动词,如káz-ma [dig–NEG](“do not dig”)。所有关键项目均出现在动词后置位置,符合土耳其语的SOV语序。值得注意的是,土耳其语中的否定也可在仅有动词、论元省略的话语中表达。目标句采用完整句形式而非仅含省略论元的动词,是为了获得恰当的神经基线,以便评估操纵效应。此外,语序也可能发生变化,如禁止性否定(如elle-mé onu [touch–NEG 3SG.ACC](“do not touch it”))。然而,此类语序变化并非本研究的关注点,因此未纳入刺激项目;考察这种变化将涉及不同的研究问题,并且需要不同的实验设计与神经时间锁定方法。韵律(P)和手势(G)操纵直接施加于动词词干:韵律呈现(P+)或不呈现(P−),手势呈现(G+)或不呈现(G−),由此形成四种实验条件:P+G+、P+G−、P−G+、P−G−(图2B)。
图2.实验刺激与范式概览。
实验条件按照拉丁方程序分为四个列表。每个列表中,每种实验条件均呈现相同数量的语篇(30项),且语篇在各条件间不重复,每个列表共120个句子。为确保实验材料的多样性与不透明性,每个列表还包含90段填充对话。这些填充对话遵循相同的语篇结构:30段为伴随掌心向上手势的否定句,30段为伴随掌心向上手势的肯定句,30段为无手势肯定句。
否定手势的具体形式依据语料库结果确定。该语料库由从YouTube视频中提取的土耳其语自由对话构成。研究特别关注后翻掌手势这一在土耳其语中可能具有地理和文化特异性的否定手势。由于本研究聚焦于形态句法标记,研究选取了使用后缀-mA构成否定动词的句子,该后缀是土耳其语标准动词否定表达的核心;并排除包含其他否定成分的句子,如“yok”(表示不存在,如“没有”)和“hiç”(强调完全缺失或否认,如“根本不”或“从不”)。此外,还排除了含系词否定“değil”的句子——“değil”否定名词性与形容词性谓语,并非形态句法标记。
最终,从87位不同说话者中总共识别出211个-mA实例。手势使用ELAN进行标注,并分为仅手部手势(如后翻掌手势)、仅非手部手势(如头部后仰)、手部与非手部手势结合(后翻掌手势加头部后仰)以及其他(摇头与横向手部动作)。手势出现在84.8%的实例中(211例中的179例)。其中,40.2%仅伴有后翻掌手势(即无任何伴随的非手部手势),35.8%同时伴随手部和非手部手势,15.6%仅伴随非手部手势,8.4%伴随摇头、横向手部动作等其他否定手势。研究选取最频繁的否定手势形式,即仅伴随含-mA否定句的后翻掌手势,作为设计刺激的范例。
刺激材料通过使用Unreal Engine的MetaHuman Creator(版本2023.1)创建的数字虚拟人呈现(图2A)。虚拟人设计为中性身体特征,以避免可能使被试反应产生偏差的特征。虚拟人被动画化以执行后翻掌手势,手势击发段(stroke)的时间设定为在言语否定标记之前400ms开始。击发段与动词词干重叠——词干均为单音节、平均时长250ms——因此击发段约在动词前150ms开始。手势相关的调制与承载相关韵律信息的片段直接对齐,从而支持二者在同一语言窗口内的可比性。这些时间参数依据语料库中35个清晰实例确定。
语音录制使用 ElevenLabs(2023)生成,经迭代调整使否定之前的音节获得突显(即更高的f0与强度);必要时在Praat(版本 6.3.01)中进一步调整,以匹配动词上类似人类的韵律标记。这些录音由土耳其语母语者审听,以确保预期的实现形式与操纵得以达成。最终动画在Unreal Engine中以高分辨率渲染,以保持虚拟人的逼真质感,并由作者核验。研究创建了两种虚拟人:语境句与目标句由男性虚拟人说出,疑问句由女性虚拟人说出。
实验流程
实验在电屏蔽且隔音的录音室进行。实验范式使用Presentation(版本22.1;Psychology Software Tools)编程,听觉刺激通过扬声器(Yamaha,HTR-4072)呈现。实验共包含210个试次,其中120个来自主实验条件,90个为填充试次。被试被要求注视每个问题后呈现500ms的注视点,试次间隔设为1500ms。被试的任务是听对话并理解其内容。实验(包括休息与佩戴电极)历时约1.5小时。
EEG记录与分析
EEG数据使用BrainAmps DC放大器系统(Brain Products)采集,采样率为1000Hz。在线记录以左侧乳突为参考,并进行0.02–100Hz带通滤波(时间常数8s)。数据从32导电极采集,电极按照标准10-20 ActiCAP导联布局放置,同时通过EOG电极监测水平和垂直眼动。
离线处理中,EEG数据在BrainVision Analyzer(版本2.2.0;Brain Products)中进行分析。连续信号先经零相位Butterworth带通滤波器(0.5–30Hz)与50Hz陷波滤波器处理,以降低工频噪声;随后,信号以左右乳突平均值为参考进行重参考。接着,数据被分割为相对于关键动词起始的−500至1000ms时段。以刺激前区间(−500 至 0ms)进行基线校正。为检测并剔除伪迹,本研究进行了独立成分分析(Infomax Restricted ICA,512步;剔除眼动伪迹相关成分:1.58±0.58)。任何包含超过±100µV的时段均被自动剔除(各条件被剔除试次:P+G+:0.33±0.86;P−G+:0.33±0.70;P+G−:0.54±0.93;P−G−:0.08±0.28)。
ERP波形与句末动词的起始锁时。分别在捕捉N100与N400成分的两个时间窗(50–150ms与300–500ms)计算平均ERP振幅。统计分析在两个ROI中进行:前部(F3、Fz、F4、FC1、FC2、C3、Cz、C4)和后部(P3、Pz、P4、CP1、CP2、O1、Oz、O2)。前后部的区分基于本研究所关注成分的形态学特征。根据假设驱动而非数据驱动的方法,时间窗与ROI依据既往文献先验定义,随后通过总平均波形与地形图的目视检查加以确认。
结果
图3A 展示了各实验条件在前部和后部ROI两个时间窗(N100:50–150ms;N400:300–500ms)上的总平均波形,并进行了基线校正调整。图3B展示了两个时间窗的地形分布,其中基线条件(P−G−)已从实验条件(P+G+、P−G+、P+G−)中减去。图4A展示了韵律条件(P+G−与P+G+合并)与无韵律条件(P−G−与P−G+合并)的比较,以及手势条件(P−G+与P+G+合并)与无手势条件(P−G−与P+G−合并)的比较结果。
图3.EEG结果概览。
对N100时间窗的目视检查发现,在后部电极点,手势出现条件(P−G+与P+G+)相对于P−G−的波幅最负。这一N100效应表明对手势的早期敏感性,很可能由手势固有的知觉突显性所驱动(图3A,左)。当合并手势出现条件(不考虑韵律)并与无手势条件比较时,这些与手势相关的突显效应清晰可见(图4A,右)。而合并韵律条件(不考虑手势)并与无韵律条件比较时,则未观察到类似效应(图4A,左)。为区分手势相关的突显效应及其对N400时间窗的潜在溢出效应,本研究采用了新的基线校正(0–200ms)。以这一新基线检查ERP数据后发现,在无手势条件下N400波幅增强,其中P+G−的反应最大(图3A,右)。总体而言,该效应在后部电极点最为明显(图3B,右),且当合并手势出现条件(不考虑韵律)并与无手势条件比较时清晰可见(图4B,右)。
图4.合并后EEG结果概览。
在R(版本4.4.2)中使用lme4包(混合模型的lmer函数)拟合线性混合效应模型,以考察ROI(前部与后部)和条件(P+G+、P−G+、P+G−、P−G−)对平均波幅的影响,并将被试作为随机截距。分析基于跨试次平均的ERP波幅,因此未估计项目水平随机效应。在第一个时间窗(N100)中,ROI(P<0.001)和条件(P<0.001)的主效应以及 ROI×条件交互作用(P<0.001)均显著,主要由后部×P−G+与后部×P+G+对比所驱动。这表明条件引起的波幅调制特异于后部区域,其中P−G+与P+G+条件诱发了更大的反应。在第二个时间窗(N400)中,ROI(P<0.001)与条件(P<0.001)的主效应显著,但 ROI×条件交互作用未达显著性水平(P>0.05)。
对N100时间窗中ROI×条件交互作用的事后分析表明,在前部ROI,波幅在各条件间表现出适度但统计学显著的调制。相对于基线条件P−G−,仅P+G+诱发了显著的负向波幅(P=0.035)。P+G+与P+G−(P<0.001)以及 P−G+(P=0.033)之间也存在差异。在后部ROI,波幅在各条件间呈现梯度差异,所有对比均高度显著。相对于基线条件P−G−,P−G+(P<0.001)与P+G+(P<0.001)的波幅更负,而P+G−的波幅次之(P=0.001)。进一步比较证实了P+G−与P−G+(P<0.001)、P+G−与P+G+(P<0.001)以及P−G+与P+G+(P=0.007)之间的差异。总的来说,在前部与后部两个ROI中,最大的N100反应均出现在P+G+条件。相对于前部ROI,后部ROI的活动表现出显著的条件依赖性变化:波幅从P−G−和P+G−条件下的正向转变为P−G+和P+G+条件下的更负向。
对N400时间窗中ROI主效应的事后分析表明,在各条件下,后部ROI比前部ROI表现出更大的N400负向波幅(P<0.001),这与既往关于N400头皮分布的文献一致。N400时间窗中条件主效应的后续分析显示,P+G−条件产生了稳健的效应,其诱发的负向波幅显著大于P−G+(P=0.028)和P+G+(P<0.001)。此外,在实验条件的两个极端之间,即P−G−与P+G+之间,也存在显著差异(P=0.007),而其余成对比较均不显著(P>0.05)。这些结果表明,手势的出现影响否定加工:手势条件(G+)相比无手势条件(即仅有韵律的条件)降低了N400负向波幅。
结论
本研究结果表明,否定加工依赖形态、手势与韵律的协同,但手势的作用最为独立稳定,而韵律因受语言形态规则制约,单独出现时无法促进否定加工。手势与韵律共现时神经整合效应最强,且该手势在自然语料中始终依附于否定言语构式,从而成为动词否定的可靠预期线索。手势在早期(50–150ms)表现出优于韵律的知觉突显性,并在中期(300–500ms)通过降低N400振幅有效减轻了否定语义的整合负荷。综合来看,韵律与手势的整合遵循多模态最优预测原则,通过先于动词后置否定形态到达的线索,显著提升了否定加工效率。线索与否定标记间的短暂间隔更支持整合观,虽无法完全排除预期性预测,但二者在实际加工中难以截然分离。本研究将多模态加工证据从词汇语义拓展至形态句法层面,证实了手势是语法的有机组成部分,并对否定后置语言具有类型学意义。
参考文献:H. Zora,P. Hagoort, & A. Özyürek, Multimodal integration supports neural processing of grammatical negation, Proc. Natl. Acad. Sci. U.S.A. 123 (38) e2605004123, https://doi.org/10.1073/pnas.2605004123 (2026).