首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏Soul Joy Hub

    ASR文本纠错模型

    ASR(语音识别)文本的错误类型很多,有多字、少字、错别字、同音近音字等等。 1. spm=1001.2014.3001.5502 上述模型考虑到了文本错字进行纠错,但在中文ASR的场景下,很多情况是由于中文拼音读音相同或相近导致的识别错误。

    3.7K20编辑于 2022-11-30
  • 来自专栏物联网思考

    ASR推出首颗国产LoRa SoC芯片ASR6601

    ASR6501、ASR6502、ASR6505之后ASR推出首颗国产LoRa SoC芯片ASR6601,ASR6501、ASR6502、ASR6505都是SIP封装的LoRa芯片。 但是此次推出的ASR6601是SoC。 与此同时,ASR6601可以达到-148dBm的超高灵敏度,以及最大22dBm的发射功率,而QFN48最小尺寸仅6mm x 6mm。 ? 在高度集成的基础上,ASR6601还支持多种调制模式。由于收发器提供的线性频率范围为150MHz〜960MHz,ASR6601可以支持各类ISM频段。 ASR6601的推出为用户使用LoRa提供了更多选择。当然,也期待更多国产芯片问世。

    4.5K10发布于 2020-09-26
  • 来自专栏VoiceVista语音智能

    ASR and the Rise of Audio Intelligence

    With the Generative aspect of ASR poised for immense growth. Extractive ASR Extractive ASR is where the audio is transcribed into text for downstream processing; Generative ASR Generative extraction is a feature which is available with most ASR’s, and will grow with Some ASR providers allow for intents and entities to be defined within their ASR solution, hence we are seeing a close coupling of ASR and NLU.

    1.7K30编辑于 2023-03-03
  • 来自专栏搜狗测试

    ASR(语音识别)评测学习

    希望对测试小伙伴有所帮助~~(●—●) 二、ASR流程、系统结构、评测指标及评测模型 1、语音识别(Automatic Speech Recognition,ASR) 语音识别,也被称自动语音识别,所要解决的问题是让机器能够 3、ASR评测模型 评测模型,各家评测模型殊途同归。下图参考为例: 首先要有测试的数据集,测试的数据集也是有一段音频和标注。标注的就是标注音频内容,说的是什么。 4、语音识别(ASR)评测指标 语音识别(ASR)评测指标:WER(字错误率)和SER(句错误率) (1). ASR句子识别错误的个数,除以音频中句子总数即为SER 其计算公式如下所示: ? 三、ASR评测影响因素 1、语⾳识别准确率影响因素 影响到准确率的因素逐渐增多,其中主要因素有以下几种: (1). ;调研用户top N的数据内容类型;收集⾼频的badcase; 4、ASR评测方案执行——过程设计 小编所在项目的ASR评测需要基于语音SDK进行,具体执行方案还在修订,遇到的问题和解决方案,小编在实践总结后再总结分享

    11.7K51发布于 2020-12-24
  • 来自专栏VoiceVista语音智能

    How to Evaluate a Deep Learning ASR System

    image.png image.png

    64110编辑于 2022-05-17
  • 来自专栏物联网思考

    ASR6505 LoRaWAN通信(一)

    前言:在LoRaWAN网络中,终端设备直接与网关通讯,设备和设备之间不通讯。设备需要先入网,再上报数据。

    1.3K21发布于 2020-10-10
  • ASR初步使用与交互体验

    Automatic Speech Recognition这里简称为ASR,说到语音产品你会想到什么,是谷歌云还是微软云提供的文字转语音工具还是siri和ChatGpt等语言交互类的产品呢? ASR可提供转录服务、实时翻译、智能交互等场景。腾讯云也提供了产品尝鲜,各位小伙伴们也可以去试试看(https://cloud.tencent.com/product/asr#mod2)。

    64220编辑于 2024-06-16
  • 来自专栏腾讯云原生实践教程

    ASR语音识别应用实践指导

    ASR 语音识别引用深度融合了腾讯云 ASR 和 TRTC,用于将 TRTC 房间的语音数据实时放回,应用运行在云函数 SCF 上,通过 API 网关暴露请求入口,客户可以直接请求 API 快速发起 TRTC 补充:ASR 语音识别应用的官方指导文档(https://cloud.tencent.com/document/product/1154/65812)整体架构预览整体流程如下:图片环境变量在应用部署之后 参考:https://cloud.tencent.com/document/product/628/56544TRTC 房间的高级权限控制线上的 TRTC 房间往往都会开启高级权限控制,而当前最新版的 ASR

    1.6K51编辑于 2022-12-09
  • ASR自动语音识别介绍

    ASR(AutomaticSpeechRecognition,自动语音识别)是让机器“听懂”人类语音并将其转化为文字的核心技术。 从智能手机的语音输入法、智能音箱的语音指令,到会议实时字幕与多语种同传,ASR已深度融入日常生活。 核心工作流程ASR将连续的声波信号转化为结构化文字主要经历以下三个关键阶段:前端信号处理与特征提取:麦克风捕捉到的模拟声音首先经过降噪、去混响和分帧加窗处理,随后提取出梅尔倒谱系数(MFCC)或梅尔频谱图 技术演进:从传统到端到端早期ASR普遍采用GMM-HMM(高斯混合模型-隐马尔可夫模型)及后来的DNN-HMM,系统模块分立且流程复杂。 当前挑战与未来方向虽然在安静环境下常见语言的识别准确率已突破95%,但在极端噪声、多说话人重叠打断、方言口音以及垂直行业专有名词(如医疗、法律)等复杂场景下,ASR仍面临一定挑战。

    8410编辑于 2026-08-20
  • 来自专栏VoiceVista语音智能

    How ASR Technologies Evolve to Improve VoiceEnabled Devices

    54920编辑于 2022-09-02
  • 来自专栏物联网思考

    ASR6505 LoRaWAN通信(二)

    前言:在ASR6505 LoRaWAN通信(一)中谈到了设备入网、ClassA、C,本节聊聊设备的信道、发送、接收数据。

    1.2K31发布于 2020-10-18
  • 利用NLU标签改进ASR重打分模型

    传统上,ASR系统采用流水线架构,包含独立的声学模型、词典和语言模型。语言模型对词序列概率进行编码,可用于在声学信号的多种候选解读之间做出决策。 端到端ASR模型以声学信号为输入并直接输出词序列,其模型体积紧凑得多,整体性能与传统的流水线系统相当。但它们通常仅使用有限的音频-文本配对数据进行训练,因此在处理罕见词时效果欠佳。 多任务训练我们的端到端ASR模型是一个循环神经网络转换器,这类网络按顺序处理输入序列。其输出是一组按概率排序的文本假设。通常,NLU模型执行两个主要功能:意图分类和槽位填充。 ASR模型文本假设的重打分仅基于词预测任务计算得到的句子概率分数(下图中“LM分数”)。训练过程中,我们需要同时优化三个目标,这意味着要为每个目标分配一个权重,以指示其相对于其他目标的重要程度。 我们将多任务语言模型的输出与ASR模型的原始输出相结合,馈送到解码器,由解码器对ASR假设进行重打分。我们实验了两种权重分配方法。一种是线性方法,将NLU目标的权重从零开始逐步增加。

    20610编辑于 2026-04-05
  • 来自专栏产品经理的人工智能学习库

    语音识别技术 – ASR丨Automatic Speech Recognition

    语音识别技术(ASR)是什么? 机器要与人实现对话,那就需要实现三步: ? 对应的便是“耳”、“脑”、“口”的工作,机器要听懂人类说话,就离不开语音识别技术(ASR)。 ? 百度百科和维基百科 百度百科版本 语音识别技术,也被称为自动语音识别 Automatic Speech Recognition,(ASR),其目标是将人类的语音中的词汇内容转换为计算机可读的输入,例如按键 它也被称为自动语音识别(ASR),计算机语音识别或语音到文本(STT)。它融合了语言学,计算机科学和电气工程领域的知识和研究。

    3.4K10发布于 2019-12-18
  • 来自专栏VoiceVista语音智能

    Sensory&Philips-Enhance ASR with Speech Enhancement

    Sensory, a Silicon Valley company enhancing user experience and security for consumer electronics, announced today its collaboration with Philips, a provider of advanced speech enhancement technologies, to offer a combined technology suite. This would package Sensory’s best-in-class speech recognition technologies TrulyHandsfree™ and TrulyNatural™ with Philips BeClear Speech Enhancement™ algorithms, resulting in significant accuracy improvement in noisy environments. By processing an audio signal with Philips’ echo cancellation, noise suppression and/or beam-forming processors before passing it to Sensory’s speech recognition engine, much of the unwanted ambient noise in a signal can be filtered out, leaving the critical speech portion of the signal largely untouched. This process allows Sensory’s already noise robust speech recognizer to decipher near- and far-field speech more accurately in conditions where very high ambient noise is present.

    71710编辑于 2022-09-02
  • 会议助手 ASR 模块迁移实战:从 Whisper large-v3 Turbo 切换到 Qwen3-ASR-0.6B

    一、为什么要迁移一个已经稳定运行的ASR模型在会议系统中更换语音识别模型,通常不是简单地修改一个模型路径。ASR模块的输出会继续进入说话人处理、时间轴对齐、会议纪要生成、全文检索和资料归档。 \Qwen3-ASR-0.6Bsha256sumQwen3-ASR-0.6B.tar.zst\>Qwen3-ASR-0.6B.tar.zst.sha256目标服务器先校验,再解压:sha256sum-cQwen3 ("ASR_MODEL_PATH","/data/models/Qwen3-ASR-0.6B",)AUDIO_PATH=os.getenv("ASR_TEST_AUDIO","/data/test/meeting 十五、接回熙瑾会悟后端时,业务层不应感知模型差异ASR服务最终只需要输出统一结构:{"engine":"qwen3-asr","model":"Qwen3-ASR-0.6B","language":"Chinese ":asr_result.engine,"asr_model":asr_result.model,"language":asr_result.language,"transcript":asr_result.text

    18310编辑于 2026-07-22
  • 来自专栏技术趋势

    语音识别ASR和NLP有什么区别?

    背景 语音识别中有两种技术分别是ASR和NLP,ASP是将语音识别转换成文本的技术,而NLP是自然语言,是理解和处理文本的过程,相当于解析器。 ASR是什么? ASR是指自动语音识别技术(Automatic Speech Recognition),是一种将人的语音转换为文本的技术。---来源网络 NLP是什么? ---来源网络 个人理解:ASR很好理解就是将语音转成文字的技术,而NLP则较为复杂,除了要翻译成文字外,还要去翻译成机器能够读懂的语言或指令,让机器接下去的流程,比如 我话了一句查下天气预报,这时候通地 ASR可以直接翻译成文本,而NLP则不仅可以翻译成文本还可以将翻译好的内容转换成具体手机要执行的指令或执行流程,所以NLP比ASR复杂很多。 参考: https://www.zhihu.com/question/268880016 https://baike.baidu.com/item/ASR/23455080?

    1.6K10编辑于 2022-03-29
  • 利用NLU标签优化ASR重评分模型

    技术背景当用户与语音助手交互时,自动语音识别(ASR)模型先将语音转为文本,再由自然语言理解(NLU)模型解析文本结构。 传统ASR系统采用流水线架构,而端到端模型虽更紧凑,但受限于训练数据规模,对罕见词识别效果欠佳。

    33700编辑于 2025-08-06
  • 来自专栏Goboy

    腾讯云语音识别(ASR)助力智慧园区落地

    此外,腾讯云ASR还自研了多模态融合算法、蒸馏算法等,以提升识别性能,并支持热词增强版、ASR情绪识别等功能。 通用语音识别:腾讯云通用ASR引擎。大模型语音识别:腾讯全新上线ASR大模型,在全行业数据集上的识别准确率极大提升。支持的语种类别请前往 控制台 查看。 腾讯云ASR服务:通过API接口与腾讯云语音识别服务连接,将录音数据上传并请求识别结果。后端控制:后端服务器接收ASR服务的识别结果,并根据指令控制智慧园区的大屏幕显示内容。 处理后的录音数据通过API上传至腾讯云ASR服务。ASR服务识别出文字内容后,将结果返回给后端服务器。后端服务器解析识别结果,并根据预设的规则或机器学习模型确定如何操控大屏幕。 .AsrClient;import com.tencentcloudapi.asr.v20190614.models.SentenceRecognitionRequest;import com.tencentcloudapi.asr.v20190614

    5.3K21编辑于 2024-05-25
  • 来自专栏ASR

    藏语ASR模型训练 | 西藏藏语语音识别 | 少数民族语音识别模型 | 维吾尔语ASR训练

    1.背景在众多的开源模型中基本上没有可以准确识别藏语的语音识别模型,无论是国外开源的Whisper,还是国内阿里开源的Qwen3-ASR,均无法识别藏语,这个你们可以自行测试。 -ASR-1.7B这个大模型来训练藏语语音识别模型的过程。 /usr/bin/envbashset-eexportCUDA_VISIBLE_DEVICES=0MODEL_PATH="/opt/asr/Qwen3/models/Qwen3-ASR-1.7B"TRAIN_FILE ="/opt/asr/Qwen3/finetuning/data/train.jsonl"EVAL_FILE="/opt/asr/Qwen3/finetuning/data/val.jsonl"OUTPUT_DIR ="/opt/asr/Qwen3/output"torchrun--nproc_per_node=1qwen3_asr_sft.py\--model_path${MODEL_PATH}\--train_file

    700编辑于 2026-08-28
  • 来自专栏AI技术体系搭建过程

    数字人关键技术1: ASR自动语音识别

    无论是智能音箱、语音助手,还是电话客服和会议转写,自动语音识别(ASR)技术都扮演着重要角色。本文将带你全面了解ASR的基本概念、技术原理、主流开源框架以及实用商用服务,助你快速掌握这项关键技术。 什么是ASRASR,英文全称Automatic Speech Recognition,中文称为自动语音识别。简单来说,它就是让电脑“听懂”人类语言的技术,能够将语音信号实时或离线转成对应的文字信息。 ASR是语音交互、智能助理、语音搜索、无障碍辅助等应用的核心基础。 ASR的技术原理ASR系统一般包含以下几个关键模块:(1) 声学模型(Acoustic Model) 将输入的音频信号转换成声学单元(如音素)的概率分布。 无论你是技术研发者,还是产品经理,理解ASR的工作原理和生态,为开发和选型提供坚实基础。开源工具和云服务让ASR变得触手可及,快速试水或深度开发均有良好选择。

    3.5K21编辑于 2025-09-15
领券