
我们该打字还是语音与LLM智能体交互——语音与键盘输入扰动全面研究论文arXiv编号2608.03970v1 | 发布日期2026-08-04论文在线HTMLhttps://arxiv.org/html/2608.03970v1论文PDFhttps://arxiv.org/pdf/2608.03970v1作者胡子昭、Nathan Elijah Segura、Mohammad Rostami、Jesse Thomason单位南加州大学、圣莫尼卡学院、南加州信息科学研究所通讯邮箱zizhaohusc.edu、jessethousc.edu摘要人类向大模型输入内容分为键盘打字、语音听写两种主流渠道两类输入会带来完全不同的文本扰动噪声键盘输入产生按键错位、字符漏输等拼写噪声语音经转录后会填充口语停顿词、语序重构、同音替换等口语化扰动。本文提出HIVEHuman Input-Variation Engine人类输入扰动生成引擎包含17种标准扰动算子2组对照算子可精准复现真实打字、语音听写带来的文本变形。基于HIVE在5款主流指令微调大模型、6类标准评测集开展大规模对照实验得到7条核心结论所有测试模型均会因语音转录扰动出现准确率下滑损伤核心来自语序重构而非口语填充词QWERTY键盘扰动带来的精度损失更小模型可耐受大量打字错误后才会性能骤降两类输入损伤的统一根源原始文本token被破坏单纯新增填充token几乎不影响模型正确率模态精度差距仅存在于推理生成类任务选择题两类输入无明显性能差异精度下降并非测试集数据泄露导致在去污染重构数据集上结论保持一致轻量化LoRA自适应微调无法修复语音输入带来的精度损失还会损害干净文本基线性能模型思维CoT机制几乎可完全抵消键盘噪声影响但对语音重构类扰动无效压缩式语音转录甚至会加剧性能衰减。本研究量化了语音/打字两种交互渠道对LLM推理的差异化负面影响为语音助手、代码智能体、办公听写前端的输入预处理策略提供工程指导。1 引言研究背景当下语音助手Siri、谷歌助手、代码智能体Claude Code、听写工具已普及用户大量使用语音口述替代打字输入。但两类输入的文本噪声存在本质差异键盘输入噪声物理按键误触带来邻键替换、字符换位、重复、漏空格等机械类拼写错误语音转录噪声ASR输出自带um/like等停顿填充词、口语倒装、同音异形词替换主流听写工具还会调用LLM对原文全局改写压缩语序。现有鲁棒性研究存在两大空白扰动算子多为理论对抗噪声无法复现人类真实输入错误缺少打字/语音两大渠道的标准化对照评测无法量化两种交互模式对模型推理的差异化伤害。本文四大核心贡献HIVE扰动引擎设计17类真实人类输入算子11种语音转录扰动、6种QWERTY键盘扰动2组实验对照算子配套完整提示词、生成脚本可批量生成带真实噪声的评测样本跨渠道量化评测固定模型、任务、样本仅切换输入扰动类型精准分离打字/语音带来的精度损失损伤归因分析定位token完整性为性能损伤核心预测指标区分“新增token”“破坏原有token”两类扰动的不同影响工程可行优化方案验证思维推理、输入预处理、微调方案的优劣为语音听写前端给出落地优化建议。2 相关工作2.1 LLM输入鲁棒性研究现有文本扰动研究分为字符级、词级、句子级三类但大多为对抗性人工噪声不符合人类真实输入规律字符级随机拼写错误、字符替换但未贴合QWERTY邻键物理错误分布词级同义词替换、乱序不区分口语自然倒装句子级释义改写但无语音听写专用压缩重构算子。现有工具如CheckList仅提供通用文本测试无法区分打字、语音两大交互场景。2.2 语音转录鲁棒性相关研究过往语音QA、语音助手评测仅使用原始ASR识别文本未区分原生口语转录、LLM改写压缩转录两种主流听写输出且缺少打字渠道作为对照组无法横向对比两类噪声危害。现有研究证实语音同音词、停顿词会降低代码、数学推理精度但未系统拆解语序重构、填充词两类独立损伤来源。3 HIVE人类输入扰动引擎整体架构HIVE包含三类输入分支语音转录扰动、QWERTY键盘扰动、无噪声复制粘贴干净文本基准算子分为LLM风格迁移生成、确定性规则变换两类全部算子开源可批量生成扰动样本配套统一评测流水线。3.1 11种语音转录扰动算子分为LLM改写类口语化/压缩改写、确定性规则修改类填充词、同音替换等两大组spoken-casual闲聊口语转录大量停顿填充词、倒装句式Qwen2.5-7B少样本风格迁移生成spoken-formal正式演讲口语少量犹豫词、完整长句spoken-succinct极简课本式压缩大幅重构语序损伤最大算子spoken-clean规整口语保留原句语序仅精简冗余spoken-clean(Llama)更换大模型重写的规整口语对照spoken-filler-stripped在闲聊口语基础上删除所有填充词cleanfillers干净文本强制插入um/like等口语填充词cleannumwords数字替换为英文单词5→fiveclean−func-words删除冠词、介词等功能词clean−case/punct移除大小写、全部标点cleanhomophone同音异形词替换无数字替换。3.2 6种QWERTY键盘确定性扰动算子全部基于达美-莱文斯坦编辑距离数字token全程保护不会被修改保证标准答案有效random-replace随机字符替换无键盘邻键约束负面对照keyboard-neighborQWERTY物理邻键替换真实打字高频错误key-swap相邻两个字符换位repeated-key按键长按重复字符connected-key同时触达两个邻键额外插入字符missed-space单词间漏输空格。两类全局对照算子实验控制变量context/question swap问题与上下文交换位置option-permutation选择题选项顺序打乱。HIVE算子完整对照表核心实验基准扰动类型算子名称平均精度损失(GSM8K)扰动生成方式语音闲聊口语spoken-casual-5.7LLM少样本迁移语音正式口语spoken-formal-2.6LLM少样本迁移语音极简压缩spoken-succinct-26.3全局最差LLM重构改写口语规整保留语序spoken-clean-6.6LLM精简填充词剥离口语spoken-filler-stripped-6.2规则删除填充词干净文本加填充词cleanfillers-3.4规则插入数字转单词cleannumwords-0.5规则替换删除功能词clean−func-words-0.7规则删减清除标点大小写clean−case/punct-2.2规则处理同音词替换cleanhomophone-1.0规则替换随机字符替换random-replace-5.1确定性随机QWERTY邻键替换keyboard-neighbor-4.2邻键映射规则字符换位key-swap-1.9规则换位重复按键repeated-key-0.6规则复制多键粘连connected-key-1.3规则插入漏空格missed-space-1.0规则删除空格4 完整实验设置4.1 测试底座大模型5款7~14B指令微调模型Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-v0.3、Qwen3-8B、Phi-4解码策略固定贪心采样消除随机采样干扰。4.2 六大标准评测数据集GSM8K/GSM-Symbolic/GSM1k数学推理应用题生成式任务HumanEvalPython代码生成单元测试pass1打分MMLU-ProSTEM子集、TruthfulQA MC1选择题仅匹配选项无自由生成每数据集抽取200条样本HumanEval全集164条每条样本匹配干净/所有扰动版本5个随机种子重复实验总生成55万条模型输出用于统计。4.2 控制变量实验方案数据集去污染对照GSM-Symbolic基于数学公式重新生成题目表面文本完全改写消除训练集记忆干扰思维开关对照Qwen3-8B开启/关闭内置CoT推理模块单独测试推理机制降噪效果LoRA自适应微调对照基于扰动样本蒸馏轻量化适配器测试微调修复能力。5 核心实验结果可视化5.1 全局精度损失总览语音类扰动整体伤害远高于键盘语音算子几何平均损失-9.7个百分点键盘仅-3.0极简语序压缩spoken-succinct是全局最差扰动数学推理精度暴跌26.3%选择题MMLU-Pro、TruthfulQA所有扰动平均损失仅1.1个百分点几乎不受噪声影响QWERTY邻键错误比纯随机字符替换损伤低0.55个百分点模型更适配真实打字噪声。5.2 关键量化指标Token留存率扰动后原始干净token留存比例与精度损失强相关相关系数r0.79仅新增填充词、不删除原有token精度几乎无下降cleanfillers仅-3.4重构语序、大量删除原有tokenspoken-succinct留存率仅52.1%精度暴跌键盘漏空格、字符换位仅少量token改动损失极小。5.3 任务类型分化规律生成类任务数学、代码语音/打字精度差距6~7个百分点选择题两类输入无显著差异模型只需匹配选项无需完整逻辑推导。6 七大核心研究发现发现1语音转录损伤根源是语序重构填充词仅充分非必要条件实验对照干净文本插入填充词仅损失3.4分但删除口语转录全部填充词后精度几乎无恢复-7.6 vs -7.4。说明停顿填充词会损伤模型但不是核心伤害口语倒装、句子拆分带来的语序重构才是精度下滑主因。发现2QWERTY打字噪声容错性更强损伤非线性累积打字错误占比低于12%时模型精度几乎持平超过阈值后性能断崖下跌相同编辑距离下邻键真实错误比随机替换损伤更低人类打字噪声对LLM更友好。发现3输入损伤统一核心原始token被破坏仅新增文本填充词、额外数字几乎不影响正确率删除、改写原有关键token会带来巨大性能衰减字符层面规律完全一致。token留存率是唯一强预测指标。发现4模态差距仅存在于需要自主推导的生成任务选择题只需匹配给定选项无需完整逻辑链语音/打字输入无精度差异数学、代码等从零构造答案的任务语音输入劣势显著。发现5精度下降并非数据集记忆泄露导致GSM-Symbolic全部题目文本重写、推理逻辑不变语音扰动精度损失幅度与原版GSM8K几乎一致-8.99 vs -8.77证明损伤来源于推理逻辑破坏而非模型背诵训练集样本。发现6轻量化LoRA自适应无法修复语音损伤高秩LoRA虽能小幅提升扰动样本精度但会大幅损害干净文本基线低秩微调不破坏原始性能但完全无法抵消语音噪声不存在两全微调方案。发现7思维推理CoT可修复键盘噪声无法抵消语序重构语音损伤开启模型思考模块后所有键盘算子精度损失几乎抹平但spoken-casual、spoken-succinct等重构类语音扰动损伤仅小幅缓解压缩改写甚至会让精度进一步下跌33.5%。原因打字仅局部字符错误思维可通过上下文还原语音重构彻底改变题干逻辑结构推理无法修复题干本身的语序错乱。7 结论与工程落地建议核心结论语音听写输入对LLM推理伤害远大于键盘打字核心损伤来自听写工具的全局语序压缩重构而非口语停顿词模型对局部打字拼写错误容错极强但无法处理大规模句子结构改写思维推理仅能弥补字符级噪声无法修复语序重构带来的逻辑偏差轻量化微调无法兼顾干净文本与口语噪声听写前端预处理是更优方案。工程实践指导语音听写前端优化禁止LLM全局压缩重构用户口述内容仅删除少量填充词完整保留原句语序不要同音词自动替换原文减少关键token改写交互渠道选型数学、代码、复杂推理场景优先键盘输入简单问答、选择题可放心使用语音模型侧优化开启CoT思维模块可大幅提升打字输入鲁棒性但不能依赖其解决语音重构问题。研究局限性全部算子、评测集仅支持英文不覆盖中文、多语言场景仅测试7~14B开源底座未测试GPT、Claude等闭源超大模型实验均为单轮问答未覆盖多轮长对话智能体场景键盘仅针对QWERTY布局未适配九宫、手机拇指键盘语音扰动为LLM文本模拟口语未使用真实音频ASR转写缺少声学噪声。附录A 完整实验方法与算子规范A.1 HIVE算子生成完整脚本伪代码# 1. LLM口语改写算子执行流程defgenerate_spoken_text(raw_question,style_prompt,shots):messages[{role:system,content:style_promptshots},{role:user,content:fWRITTEN:{raw_question}}]outputsmodel.chat(messages,temp0.1)returnextract_tag(outputs,spoken)# 2. QWERTY确定性扰动函数defqwerty_perturb(text,op,word_ratio0.2):char_mapget_qwerty_neighbor_dict()wordstext.split()target_numint(len(words)*word_ratio)seed_rngRandom(hash(text))target_wordsseed_rng.sample(words,target_num)new_words[]forwinwords:ifwintarget_wordsandnotw.isdigit():new_wapply_key_op(w,op,char_map)new_words.append(new_w)else:new_words.append(w)return .join(new_words)A.2 全套LLM提示词模板附录C完整原文spoken-casual/spoken-formal口语生成提示spoken-succinct精简压缩提示spoken-clean语序保留精简提示改写歧义判定打分提示Meaning-drift judge。A.3 统计分析方案每组实验5个随机种子采用配对t检验、Bonferroni多重校正图表误差条为95%学生t置信区间单样本拆解人工标注20组数学错题分类故障类型前提范围偏移55%、末尾问题丢失25%无计算错误。附录B HIVE算子完整对照表包含17种扰动算子的生成方式、控制参数、修改样例、语义漂移占比见论文Table4所有算子可直接复现用于鲁棒性评测。资源完整下载清单论文HTML在线版https://arxiv.org/html/2608.03970v1论文PDF全文https://arxiv.org/pdf/2608.03970v1HIVE扰动生成完整Python代码论文配套开源仓库见文末github地址全套提示词模板仓库prompts/目录批量评测执行脚本run_benchmark.py、stat_analysis.py实验结果绘图代码plot_exp_figures.py处理后扰动评测数据集HuggingFace数据集仓库LoRA自适应微调训练脚本train_lora_adapt.py