互联网资讯 · 2023年11月1日 0

AI大模型导致语言不平等:英语成本低于其他语言

7月31日消息,用户使用的语言显著影响大型语言模型的成本,这可能导致英语用户与其他语言用户之间出现人工智能鸿沟。近期研究表明,由于服务提供商在服务器成本的计算和计费方式上,英语的输入和输出费用远低于其他语言。例如,简体中文的费用约为英语的两倍,西班牙语的费用为英语的1.5倍,而缅甸的掸语则高达英语的15倍。

推特用户Dylan Patel分享了一张图片,展示了牛津大学的一项研究,指出处理一句缅甸语句子需要198个词元,而同样的句子用英语只需17个词元。词元是通过API访问时所需的计算能力的衡量,这意味着缅甸语句子的使用成本是英语句子的11倍。

词元化模型的存在使得除了英语以外的其他语言在使用和训练模型时更加昂贵。这是由于像中文这样的语言具有不同且更复杂的结构,导致它们需要更高的词元化率。例如,根据分词器,“你的爱意”在英语中仅需两个词元,而在简体中文中需要八个词元,尽管简体中文文本只有4个字符,而英文有14个字符。