范式缺失:前沿模型为何难以理解本土语境
各位下午好,我是 Jin Kang,目前在 AI Singapore(新加坡国家人工智能项目)负责模型开发。今天非常荣幸能在这里与大家分享 Project SeaLion。在开始之前,我想邀请大家共同思考一个问题:前沿大模型(Frontier Models:指目前性能最强、规模最大的 AI 模型)是否真的强大到足以理解本土语境?
我的答案是否定的。我们观察到的核心现状是:尽管市场上存在许多极其强大的、以英语和中文为基础的领先模型,但用户依然迫切需要能够使用母语进行交流互动的大语言模型(Large Language Model: 基于海量文本训练的 AI 系统)。全球仍有许多地区的人们在日常生活中并不使用英语或中文。想象一下,如果你能告诉他们,现在可以构建能够使用他们最熟悉、最舒适的母语进行交互的 AI 应用,这对他们来说是否更具吸引力且更实用?
因此,AI Singapore 开发了 SeaLion 系列模型。SeaLion 代表“Southeast Asian Languages In One network”(东南亚语言统一网络),反映了我们服务东南亚社区的目标。目前该模型已针对印尼语、马来语、泰语、菲律宾语、缅甸语等多种语言进行了深度训练。不幸的是,在英语和中文之外,大模型的自然语言处理能力和文化理解能力仍存在巨大的断层。东南亚拥有超过 7 亿人口和 1,200 多种语言,这种多样性导致四分之三的东南亚人无法从 AI 的变革潜力中获益。我们相信,只有当模型能用母语进行自然对话时,它们才会产生亲和力,进而推动 AI 的普及。
算法偏见:训练数据带来的“文化距离”与成本鸿沟
哈佛大学曾发表过一篇题为《哪些人类》(Which Humans)的研究,指出前沿的英语大模型与全球许多国家和文化并不契合,东南亚也不例外。研究强调,现有的英语模型与东南亚地区存在巨大的“文化距离”。其根本结论在于:模型生成的输出是其训练数据的代表,这意味着模型必然包含各种偏见。
这种偏见可能源于设计者的价值观导向,例如在描述历史事件时由于开发者的倾向而产生立场偏移;也可能源于数据的代表性失衡。美国数据在英语语料中严重过载,导致模型体现出强烈的美国文化色彩。再比如,泰米尔语虽是新加坡的官方语言之一,但在互联网语料中,来自印度本土的数据远多于来自新马地区的数据,导致了区域性的代表性不足。
更深层的影响存在于分词算法(Tokenization Algorithm: 将文本切分为 AI 可处理单元的算法)中。在处理泰米尔语、泰语或缅甸语等非拉丁字母脚本时,模型往往需要比英语多出 5 到 10 倍的 token(Token: 文本处理的基本单位)来表达同样意思的句子。在实际应用中,这意味着根据你选择的模型,非拉丁语系的用户可能需要支付数倍甚至十倍的推理成本。这种性能和成本上的不平衡,使得东南亚用户面临被 AI 红利排斥的真实风险。
语义深度:从语言翻译到文化隐喻的精准捕捉
SeaLion 的设计初衷就是为了应对这种多样性。我们在强大的现有开源模型基础上,利用超过 1 万亿 token 的高质量本土数据进行训练,旨在提取更深层次的跨文化理解力。我们追求的是区域卓越性、多模态能力、资源效率以及安全性。
一个直观的例子可以说明“多语言模型”与“多文化模型”的区别。在菲律宾语中,女性用户可能会问:店里有没有“meron”?她需要买一些“ano”。在这个语境下,“meron”是生理期的隐喻,而“ano”则是卫生棉的代称。一个虽然强大但缺乏本土文化训练的多模态模型,虽然能给出连贯的回答,却无法识别这些委婉语,可能会列出胃药、止泻药等药店常见商品,但这完全不符合用户的真实需求。
相比之下,SeaLion 能够准确识别出用户在使用隐喻,并列出止痛药、卫生棉(菲律宾惯称 pads 或 napkins)等针对性建议。这种互动让用户感到模型“懂我”。同样的情况也发生在中文语境中:如果你问模型“我大姨妈来了怎么办”,如果模型由于缺乏本土语境而告诉你如何接待到访的亲戚,那它就完全失去了使用价值。
为了让 SeaLion 理解这些微妙的差异,我们必须直接与母语者社区合作。我们不仅需要高质量的语料,也需要中等甚至低质量的数据,因为口语、俚语和对话数据往往混合其中。只有母语者能告诉我们哪些表达是正确的。同时,我们通过人工巡检来剔除互联网数据中的垃圾信息,如弹出式博彩广告,确保模型学习到的是纯净的通用知识和文化常识。
社会效应:从助残翻译到保障劳工权益的 AI 实操
目前的 SeaLion 模型库涵盖了从 40 亿到 700 亿参数不等的规模,支持 Llama、Gemma、Qwen 等多种架构,并提供配套的安全模型 Seagull(支持东南亚语言的安全性任务)和嵌入模型。
这些能力的整合已经产生了实实在在的社会价值。在数月前举办的东南亚开发者挑战赛中,有团队利用 SeaLion 开发了柬埔寨手语转文字应用。在许多东南亚国家,手语资源稀缺且由于缺乏资金支持而难以普及。该应用通过实时捕捉手势并将其转化为文字,极大地缓解了听障人士与普通人之间的沟通障碍。
另一个已落地的案例是针对外籍劳工的聊天机器人。新到新加坡的务工人员由于语言障碍和法律文化的差异,往往不了解自己的合法权益,甚至在遇到基础生活需求时也无所适从。我们构建的机器人可以用印尼语、菲律宾语或缅甸语给出准确、具有亲和力的回复。
在开发过程中,一位劳工询问模型能否推荐“好牙医”。这看似琐碎,但对他们而言至关重要——他们可能没有牙科保险,且希望节省每一分钱汇回老家。由于 SeaLion 训练中包含了新加坡专门服务外籍劳工、且配有语言翻译的公益诊所信息,它能给出极具价值的建议。在我们的结项评估中,一位工人说:“SeaLion 触动了我的心。”这让我们深感欣慰,也再次确认了将 AI 作为向善力量的目标。东南亚社区的支持让我们感激不尽,我们期待 SeaLion 能持续为这个地区的本土化需求贡献力量。谢谢大家。
📌 文中提及的人物和组织
公司/组织: AI Singapore, Harvard University