返回查看识别原理OMR 有哪些更新

PDF 和照片扫描新变化

由光学乐谱识别(OMR)驱动的 Opuscan 扫描能力持续提升。本页记录 PDF 和照片导入的更新,最新内容在前。

条目由英文自动翻译。 阅读英文原文

9月28日·已改进·

新版模型可识别不常见的拍号和未标谱号的谱行

我们更新了扫描模型,重点改进了拍号、谱号和多小节休止符的识别。

  • 更多拍号能按原谱识别。 模型现在能识别 29 种拍号,以及普通拍子和二二拍的符号。本月新增了民间音乐、爵士乐和当代音乐中常见的 6/4、7/4、8/4、9/4、10/8、11/8、13/8、14/8、15/8、9/16、11/16、13/16、15/16 和 17/16。以前,这些拍号会被替换成更常见的拍号(10/8 变成 12/8,8/4 变成 5/4),导致小节时值对不上,音符也会被删掉以凑足时值。请参阅扫描支持的所有记谱元素。
  • 多小节休止符能保留实际长度。 在管乐团和管弦乐团的分谱中,长休止符上方的数字表示需要数过多少小节。现在这个数字被误读的情况大幅减少。以前,“10”可能被读成 100,让分谱多出几十个空白小节。
  • 未标谱号的谱行能保持正确音高。 许多分谱,尤其是爵士乐谱和旧版乐谱,只在每页第一行标出谱号。以前,模型会猜测其他谱行的谱号;一旦猜错,整行音符的音高都会偏高或偏低。现在这些谱行会沿用上一行的谱号。
  • 更少添加原谱上没有的内容。 三连音上方的小“3”不再被识别为指法,未印出的八度线 (8va) 不会被添加,整行休止的五线谱也不再被填入打击乐音符。
  • 更多音符能进入乐谱。 如果识别出的小节总时值超过拍号允许的时值,就必须舍弃部分音符,让小节时值符合拍号。现在节奏和拍号的识别更准确,这种情况大幅减少:在我们测试的导入结果中,漏掉的音符减少了约 70%。

也收录于 九月

32 项小改动
8月7日·已改进·

支持隐式连音的新模型版本

我们自研模型的新版本现已用于所有 PDF 和照片导入,重点改进了对页面上连音组印刷方式的识别。

  • 现已支持隐式连音。 制谱人员通常只会在一段乐句中第一组三连音或六连音上方标一个小小的“3”或“6”,后续同样的分组则不再重复标注——默认演奏者会延续这一模式。这些没有标记的分组就是隐式连音:实际要按连音演奏,但页面上没有明确写出来。它们在 19 世纪版本、练习曲和变奏曲中非常常见。现在,扫描会根据小节的节奏将它们还原出来,而不是为了让小节符合拍号而删掉音符。
  • 凭空生成的连音更少了。 过去,即使普通的符杠分组上方没有印数字,模型也可能把它们识别成三连音,于是这些数字会出现在你的乐谱里。现在,只有页面上确实画出了连音标记的地方,才会写入连音。

也收录于 八月

19 项小改动
7月29日·已改进·

全新模型版本,提升扫描乐谱识别准确率

我们自研模型的新版本现已用于所有 PDF 和照片导入,在扫描乐谱基准测试中的错误率降低了 22% 到 51%。提升在较难的页面上最明显——例如较老的雕版印刷谱面和印刷不均匀的页面。

7月24日·已改进·

新版模型重点修复记谱问题

Flat 自研模型的改进版本现已用于所有 PDF 和照片导入,尤其包括:

  • 现已支持带共享休止符和隐藏休止符的多声部段落。
  • 小节线和反复结束括号(volta)现在可以在小节内正确放置。
  • 连梁的识别现在更可靠。
  • 现在可以识别像管弦乐总谱那样跨多个谱表绘制的拍号。
  • 修复了部分和弦符号导出到 MusicXML 时使用非标准和弦类型的问题。
7月21日·新增·

适用于 Windows 的 Opuscan

Opuscan 这款独立的扫描转乐谱应用现已支持 Windows,并与 macOS、iPhone、iPad 和 Android 一同提供。扫描纸质页面或打开 PDF,即可获得可编辑、可播放的乐谱,并可导出为 MusicXML 和 MIDI,无需 Flat 账号。

7月15日·新增·

适用于 iPhone 和 iPad 的 Opuscan

Opuscan——我们独立的扫描转乐谱应用——现已登陆 App Store,支持 iPhone 和 iPad,加入 macOS 和 Android 应用行列。拍摄页面照片或打开 PDF,即可获得可编辑、可播放的乐谱,并可导出为 MusicXML 和 MIDI——无需 Flat 账号。

7月10日·新增·

适用于 macOS 和 Android 的独立 Opuscan 应用

Opuscan——我们的独立乐谱扫描应用——现已推出专为 macOS 和 Android 打造的应用版本。它基于与 Flat 相同的自研 OMR 引擎,可让任何人将 PDF 或纸质乐谱照片转换为可编辑、可播放的乐谱,并导出为 MusicXML 和 MIDI,无需 Flat 账户。它面向那些只想使用扫描技术并将结果导入自己喜欢的音乐软件的用户,无论是制谱软件(MuseScore、Dorico、Sibelius、Finale)还是 DAW(GarageBand、Logic Pro、Ableton Live)都适用。可在 Mac App Store 或 Google Play 获取。

也收录于 七月

11 项小改动
6月23日·已改进·

针对复杂版面的页面分析更精准

我们改进了扫描时对页面版面的读取方式。现在导入 PDF 和照片时,生成的乐谱会更干净、更准确,尤其是在复杂版面中:

  • 内容密集的页面现在能正确拆分。 对于上下堆叠了许多短行谱表的页面,不会再被合并到一起——每个系统都会被单独检测出来。
  • 更适合管弦乐总谱和大型合奏总谱。 钢琴、管风琴等多谱表乐器,以及包含许多谱表的大型总谱,现在都能更可靠地识别。
  • 宽版、横向和小册子版式。 横向页面的左边缘不再被裁切(否则可能会切掉谱号),多页扫描和小册子扫描现在也能被正确处理。
  • 更少的误检。 页面页脚和边距附近的无关元素不再被误识别为音乐内容。
6月15日·已改进·

更精确的模型

现在,所有 PDF 和照片导入都会由 Flat 自研的内部模型处理。这个版本是一次重要的新版本更新,重点提升了转谱准确性:在所有测试集中,乐谱的音乐正确性(决定乐谱是否正确的音符、节奏、连结线和临时记号)都有所提升,其中提升最明显的是:

  • 力度记号:+39%
  • 延长记号、演奏法、连结线、临时记号:+30 to 37%
  • 音符时值:+22%
  • 连线、附点音符、休止符、谱表和声部分配:+14 to 20%

文本、力度记号和版面位置也更加精确:歌词、和弦名称和力度记号现在能更可靠地附着到正确的音符上,包括钢琴大谱表以及带有谱号变化的声部等复杂版面。

6月1日·新增·

我们自研的 AI 模型开始逐步上线

我们正在逐步上线 Flat 自研的 PDF 和照片导入 AI 模型。该模型由我们内部设计并训练,用来替代产品上线时使用的第三方引擎。拥有端到端的技术能力后,我们可以进一步提升准确率,扩展可识别的记谱内容,更快交付改进,并让识别结果更好地贴合 Flat 自身的乐谱格式,使导入内容能够更自然地融入产品的其余部分。仅首个版本,就已经能读出你乐谱中更多的内容:

更广的记谱覆盖范围。 新增可识别内容:

  • 和弦符号,会按其音乐含义正确编码为可编辑的和弦,而不只是普通文本
  • 小节反复记号和节奏斜线
  • 速度标记和节拍器标记(含 BPM)

支持更多语言的歌词和文本。 现在默认可识别使用拉丁字母的语言中的歌词、排练记号及其他文本,同时也支持日语、韩语和中文。

更贴近原始版面。 现在导入结果会更紧密地遵循源乐谱的版面布局,包括每行的小节数、每页的系统数以及整体结构。这对于大型复杂乐谱(如管弦乐作品)以及钢琴这类多谱表乐器尤其有帮助。现在还支持更多页面格式,包括此前不支持的横向页面。

也收录于 六月

8 项小改动