返回查看识别原理OMR 有哪些更新

PDF 和照片扫描新变化

由光学乐谱识别(OMR)驱动的 Opuscan 扫描能力持续提升。本页记录 PDF 和照片导入的更新,最新内容在前。

支持隐含连音符的新模型版本

制谱师通常只在一个乐句的第一个三连音或六连音上方印上小小的“3”或“6”,后面的连音组则不再标注——演奏者应自行延续这一节奏型。这些没有标注的连音组就是隐含连音符:按连音演奏,但谱面上没有任何标记说明。它们在 19 世纪版本、练习曲和变奏曲中非常常见。

  • 新增现已支持隐含连音符:不再为了让小节符合拍号而删掉音符,而是从小节的节奏中还原出连音组。
  • 优化凭空生成的连音符大幅减少——只有页面上确实印有数字的地方,才会在乐谱中写入连音符。
  • 新增现已识别谚文标题和韩语演奏术语。
  • 修复排练记号现在归属于它所开启的小节,而不是最近的一个音符。
  • 修复此外还有一批较小的修复,涉及歌词、和弦符号、乐器名称、六线谱、弱起小节和乐谱信息。

专注于扫描乐谱准确率的新模型版本

我们自研模型的新版本现已用于所有 PDF 与照片导入,在扫描乐谱基准测试中错误减少 22% 至 51%。在较难处理的页面上提升最为明显——例如年代较早的雕版印刷和印刷不均匀的乐谱。

专注于记谱修正的新模型版本

我们自研模型的改进版本现已用于所有 PDF 与照片导入,尤其包括:

  • 新增现已支持带共享休止符与隐藏休止符的多声部段落。
  • 修复小节线与反复结尾(volta 括号)现在能在小节内正确放置。
  • 优化连音线(beams)的识别更可靠。
  • 新增现已可识别跨多个谱表绘制的拍号(如管弦乐总谱中常见的写法)。
  • 修复修复了部分和弦符号导出为 MusicXML 时使用非标准和弦类型的问题。

Windows 版 Opuscan

  • 新增Opuscan——我们的独立“扫描转乐谱”应用——现已在 Windows 上线,并与 macOS、iPhone、iPad 和 Android 一同提供。扫描单页或打开 PDF,即可获得可编辑、可播放的乐谱,并可导出为 MusicXMLMIDI

记谱与识别改进

  • 新增现已可识别发生在小节中间的谱号变更。

iPhone 与 iPad 版 Opuscan

  • 新增Opuscan——我们的独立“扫描转乐谱”应用——现已在 App Store 上架,支持 iPhoneiPad,并加入 macOS 与 Android 应用阵容。拍摄一页或打开 PDF,即可获得可编辑、可播放的乐谱,并可导出为 MusicXMLMIDI

面向 macOS 与 Android 的专用 Opuscan 应用

  • 新增Opuscan——我们的独立“扫描转乐谱”应用——现已推出 macOSAndroid 专用版本。它基于相同的自研 OMR 引擎,让任何人都能将 PDF 或乐谱照片转换为可编辑、可播放的乐谱,并导出为 MusicXMLMIDI。它适合只想把扫描技术接入自己常用音乐软件的人群,从记谱软件(MuseScore、Dorico、Sibelius、Finale)到 DAW(GarageBand、Logic Pro、Ableton Live)。可在 Mac App StoreGoogle Play 下载。

OMR 现已作为开发者 API 提供

  • 新增Opuscan 的 OMR 引擎现已可通过开发者 API 以编程方式调用。上传 PDF 或照片,跟踪识别进度,核对检测到的乐器,然后将结果作为可编辑乐谱导入乐谱库,或导出 MusicXMLMIDI。这正是驱动编辑器中 PDF 与照片导入的同一套自研模型,现在也能按需规模化用于您自己的应用与工作流。

记谱与识别改进

  • 新增现已可识别提示(cautionary)变音记号。
  • 修复修复了部分双声部段落中两个声部共享同一个休止符的情况。

面向复杂版式的更清晰页面分析

我们改进了扫描对页面版式的读取方式。现在导入 PDF 与照片时能生成更干净、更准确的乐谱,尤其适用于复杂版式:

  • 优化密集页面现在能正确分拆。 当页面上堆叠了许多较短的谱表系统(system)时,不再被合并为一块——每个系统都会被单独检测。
  • 优化更适合管弦乐与大型合奏总谱。 钢琴、管风琴等多谱表乐器,以及拥有大量谱表的大型总谱,识别更可靠。
  • 优化更好支持横向、宽幅与小册子版式。 横向页面不再裁掉左边缘(避免谱号被截断),多页与小册子扫描也能正确处理。
  • 修复更少误检。 页面页脚与边距附近的杂散元素不再被误识别为乐谱内容。

记谱与识别改进

  • 新增现已可识别并在导入时保留自定义连音线分组(beaming)模式。
  • 新增现已支持跨休止符的连音线(例如:音符 / 休止符 / 音符)。
  • 新增对于能正确识别为爵士谱的乐谱,现在会自动应用爵士和弦样式与手写风格的爵士乐谱字体。

更精确的模型

现在每一次 PDF 与照片导入都会由 Tutteo 自研模型处理。本次发布是一个聚焦转写准确性的重大新版本:在所有测试集上,音乐正确性(决定乐谱是否正确的音高、节奏、连音、变音记号等)均得到提升,提升幅度最大的包括:

记谱 提升
力度记号 +39%
延音记号、演奏法记号、连音线、变音记号 +30 至 37%
音符时值 +22%
圆滑线、附点音符、休止符、谱表与声部分配 +14 至 20%

文本、力度与版面位置也更精确:歌词、和弦名称与力度记号能更可靠地附着到正确的音符上,即使在钢琴大谱表或包含谱号变更等复杂版式中亦是如此。

我们自研的 AI 模型开始逐步上线

我们正在逐步推出自研的 AI 模型,用于 PDF 与照片导入,以替换上线初期使用的第三方引擎。端到端掌握技术让我们能够进一步提升准确率、扩展可识别内容、更快交付改进,并让识别结果与 Tutteo 自身的记谱格式更一致,使导入内容能自然融入产品的其他功能。此首个版本已能读取更多乐谱内容:

更广的记谱覆盖。 新增可识别内容包括:

  • 新增和弦符号:以可编辑和弦的形式按其音乐含义正确编码,而不仅是纯文本
  • 新增小节反复记号与节奏斜线(rhythm slashes)
  • 新增速度与节拍器标记(含 BPM)

更多语言的歌词与文本。 默认支持拉丁字母书写语言的歌词、排练记号及其他文本,同时也支持日语、韩语与中文。

更贴近原谱版面。 现在导入结果会更紧密地遵循源谱的版式,包括每行小节数、每页系统数以及整体结构。这在管弦乐作品等大型复杂总谱、以及钢琴等多谱表乐器的乐谱上效果尤为明显。同时也支持更多页面格式,包括此前不支持的横向页面。

PDF 导入上线

PDF 导入现已可用,可将乐谱 PDF 转换为可编辑的乐谱。该功能由第三方光学乐谱识别技术驱动。


本页面是从英语自动翻译的。查看英语原版