1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
中文名确定!Token正式被译名为“词元”:我国日均调用量突破140万亿
2026年3月24日,国家数据局首次正式将Token译名为“词元”,标志着中文人工智能领域术语标准化的确立。国家数据局局长刘烈宏在新闻发布会上透露,我国日均词元调用量已突破140万亿,较2024年初增长超千倍,并较2025年底增长40%以上。这一数据表明中国人工智能发展进入快速增长阶段,应用场景不断深化,产业竞争力显著增强。《人民日报》此前发布科普文章,定义词元为“处理文本的最小数据单元”,苹果中国官网、央视新闻等机构也统一采用此译名。词元可理解为人工智能模型处理数据时的最小信息载体,如“我爱中国!”可拆分为4个词元。随着人工智能时代的到来,词元已成为衡量信息处理的关键指标。
量子黑客
03-24 16:01:46
token
人工智能
词元
分享至
打开微信扫一扫
内容投诉
生成图片
GPT-4o 见AV 女优的次数比“您好”还多2.6倍,AI 正在被中文互联网疯狂污染
2025年9月6日,一项由清华、蚂蚁和南洋理工联合发布的研究揭示,大语言模型如GPT-4o存在严重的中文数据污染问题。研究发现,AI对“波多野结衣”等成人内容的熟悉度比日常用语“您好”高出2.6倍,超过23%的长中文词元与色情或网络赌博相关。这些“污染词元”源于高频垃圾信息,虽被算法收录,却因缺乏有效训练导致语义理解缺失。研究团队开发了POCDETECT和POCTRACE工具检测污染程度,结果显示GPT系列污染率高达46.6%,而其他模型如GLM4和DeepSeek-V3表现较好。论文指出,互联网语料中的灰色内容难以彻底清理,AI的智能仍基于统计概率,而非真正认知。这提醒我们,AI的缺陷映射了数字环境的现状。
元界筑梦师
09-06 12:37:21
大语言模型
数据污染
污染词元
分享至
打开微信扫一扫
内容投诉
生成图片
如何让大模型感知知识图谱知识?蚂蚁联合实验室:利用多词元并行预测给它“上课”
如何让大模型感知知识图谱知识?蚂蚁联合实验室提出K-ON方法 大语言模型的发展打破了自然语言处理任务间的壁垒,但知识图谱与自然语言间存在粒度不匹配。为解决此问题,蚂蚁团队提出K-ON方法,利用多词元并行预测机制,实现语言模型实体层级的对比学习。 K-ON方法通过五个步骤完成知识图谱补全任务:将问题以...
AI思维矩阵
02-24 17:29:32
多词元并行预测
大模型
知识图谱
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序