语音架构
什么算作一个音节?
音节是口头语言的一个单位,由单个元音(核心)加上其前后的可选辅音(首音和尾音)组成。在英语韵律学中,音节是格律、节奏和诗体形式的基本构件。
然而,简单的元音字母计数器严重失败:'breeze' 有 1 个音节(不发音的 'e'),'cloud' 有 1 个音节(双元音),'summer's' 有 2 个音节(元音 + 音节性辅音 'r')。真正的音节计数器必须参考口头语音学,而不是正字法。
诗体音节约束
5-7-5、10 音节及以上
许多传统诗体形式对每行施加精确的音节数限制。日本俳句在三行中强制执行 5-7-5(总共 17 个音节)。意大利十四行诗强制执行 11 个音节(endecasillabo)。莎士比亚十四行诗使用抑扬五音步的十音节行(10 个音节)。
我们的音节计数器显示逐行计数和总音节数,每个诗节的平均值,并将词典无法解析的单词标记为'估计'以供手动审查。
语音算法与 CMU 词典
引擎如何解析每个单词
每个单词都与 CMU 发音词典进行匹配,该词典是一个公开可用的语料库,包含 134,000+ 语音 ARPAbet 音素格式的英语转录。查找返回标准音节数和重音模式,然后工具将这些聚合到整行中。
如果词典中没有该条目,工具会回退到一种语言学启发式方法,尊重不发音的 e、-le 尾音规则和双元音检测,而不是简单的元音字母计数,并且受影响的单词会高亮显示为估计值,用户可以交互式地纠正。
方言、缩约词和边缘情况
跨英语变体的音节
具有多个有效发音的单词(every、hour、often)用明确的置信度等级标记,让诗人选择适合其格律的变体。缩约词('don't, 'tis)在其完整语音形式中拆分查找。
连字符词和复合词('sun-flower'、'heartbreak')在其形态边界处拆分并分别计数。词典中没有的专有名词和外来词被标记以进行交互式审查,确保甚至可以透明地处理模糊的古体和方言词汇。