DeepSeek V4 最近开源了多模态权重,它不仅能“看图”,还将视觉深度融入了AI大脑。
图片如何变成模型懂的“语言”?图片先被切成小块提取特征,保留空间位置。接着,“秘书”(Aligner)将相邻的9个特征打包压缩,把庞大的图像精炼成最多384个“视觉词(Token)”送入主干。这既保留了画面细节,又控制了数据量。
进入大脑后,视觉词和文字词虽在同一空间交流,但视觉词享有“VIP待遇”。为了让模型看清整张图,视觉词的“视野(Attention)”被特意扩大;在分配计算专家(MoE)时,视觉词也有专属路由通道,不用和文字挤同一条路,让模型能充分发挥多模态特长。
V4 的核心目标不仅是识别图片,更是赋能AI智能体(Agent)。例如让AI操作浏览器,它需反复截图、观察、点击。但这带来了算力挑战:若页面只变了一个按钮,重新计算整张截图会造成巨大浪费。未来的优化方向将是只计算变化的部分(视觉差分)或缓存历史画面。
总之,V4 把图片变成了推理的“原生上下文”。未来多模态AI的竞争,不仅在于谁能“看懂”世界,更在于谁能以极低的算力成本,持续、高效地“观察”世界。
原文链接
本文链接:https://kx.umi6.com/article/37699.html
转载请注明文章出处
相关推荐
换一换
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
2026-08-27 01:50:21
源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude
2026-08-15 15:11:44
中国AI凭什么逆袭美国?
2025-06-26 13:58:23
美团发布并开源 LongCat-Flash-Omni 模型:支持实时音视频交互,达到 SOTA 水平
2025-11-03 11:17:00
520当天400万AI人,都在量子位听这近20场演讲&对谈|第四届中国AIGC产业峰会
2026-05-21 14:43:04
全球首个深度推理+多模态大模型“紫东太初”4.0发布
2025-09-19 13:13:31
智谱 GLM-4.6V 系列多模态 AI 大模型发布并开源,API 降价 50%
2025-12-08 20:45:30
合肥又押中AI独角兽:多模态赛道,3个月融了21亿
2026-07-24 23:02:56
Meta发布最强开源Llama 4,超越DeepSeek V3
2025-04-06 10:58:02
Meta亿元天团首个大模型交卷!余家辉宋飏Jason Wei耗时九个月,一雪Llama前耻
2026-04-09 09:56:45
破天荒!DeepSeek V4正式版居然要涨价,而且翻着倍地涨
2026-06-30 12:18:51
GPT-5来了!人人都能免费用,最强大模型只需最傻瓜式使用
2025-08-08 04:01:37
DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片
2026-04-24 13:09:49
801 文章
986631 浏览
24小时热文
更多
-
2026-09-01 18:52:06 -
2026-09-01 16:59:26 -
2026-09-01 16:57:36