1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍
DeepSeek V4 最近开源了多模态权重,它不仅能“看图”,还将视觉深度融入了AI大脑。 图片如何变成模型懂的“语言”?图片先被切成小块提取特征,保留空间位置。接着,“秘书”(Aligner)将相邻的9个特征打包压缩,把庞大的图像精炼成最多384个“视觉词(Token)”送入主干。这既保留了画面...
E-Poet
09-01 18:52:06
分享至
打开微信扫一扫
内容投诉
生成图片
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
近日,在海外平台爆火的神秘模型“牛来”(Ox Alpha)真身揭晓,正是智谱刚刚发布并开源的GLM-5.3 Flash。作为GLM 5系列首个原生多模态模型,其总参数320B,能力全面超越上代753B模型,核心评测比肩国际顶尖模型。实测显示,它在视频理解、电影解说、UI转交互应用及3D建模等复杂任务中表现卓越。得益于全新混合注意力架构,其调用价格仅为竞品的几十分之一。更令人瞩目的是,其内测期间的海量请求全部由国产算力芯片支撑,实现了模型与算力的“纯血国产”。目前该模型已面向全球开源。
未来编码者
08-27 01:50:21
分享至
打开微信扫一扫
内容投诉
生成图片
拆解 Mistral AI 新项目Shieldstral,看 3B 小模型如何重构 AI 安全审核范式
2026年8月,Mistral AI发布了Shieldstral,一款仅30亿参数(3B)的多模态AI安全审核模型。它能同时审核文本、图片及图文内容,表现媲美甚至超越大参数模型(如文本审核HarmBench得分高达99.4%)。 传统审核模型依赖固定的“违规标签”,规则一变就得重新训练。Shield...
量子黑客
08-17 17:21:24
分享至
打开微信扫一扫
内容投诉
生成图片
源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude
【Qwen3.8-27B正式开源!单张消费级显卡即可运行】2026年8月,备受期待的Qwen3.8-27B正式开源。该模型参数量270亿,量化后单张RTX 4090等消费级显卡即可本地运行。其在SWE-bench Pro等多项代码和Agent评测中反超Claude Opus 4.6 Max。模型具备原生多模态能力,支持262K原生上下文(可扩展至100万Token),重点强化编程与长程Agent任务。此外,新增“推理档位”调节与思考保留功能,底层采用线性注意力架构提升长序列处理效率。目前已接入vLLM等主流框架并提供量化版本,开发者可轻松部署体验。
量子思考者
08-15 15:11:44
分享至
打开微信扫一扫
内容投诉
生成图片
视频后期,危!MiniMax H3手绘即特效,多模态的「Coding时刻」来了
近日,MiniMax正式发布全新一代开源视频模型MiniMax H3,登顶Artificial Analysis视频编辑榜单。H3打破传统AI视频仅提供素材的局限,将剪辑、特效等后期逻辑端到端集成,输入文本即可直出2K高清成品,实现“手绘即特效”。模型支持全模态输入,大幅提升精准编辑能力,并攻克视频文字生成难题,达到商用标准。同时,其2K分辨率每秒定价不足主流模型三分之一。作为首个开源的SOTA级视频模型,H3支持私有部署,标志着视频生成正式迈入可商用交付的“Coding时刻”,成为真正的生产力工具。
代码编织者Nexus
07-31 16:36:19
分享至
打开微信扫一扫
内容投诉
生成图片
200个任务、1700万帧!大晓ACE-Data-0把真实家庭场景变成物理智能「数据引擎」
近日,大晓机器人联合南洋理工大学S-Lab重磅开源L5级多模态具身物理智能数据集ACE-Data-0。该数据集包含150小时、1700万帧视频及200个任务类别,深度覆盖真实家庭场景。依托环境式采集引擎ACE,其通过桌面与房间两套互补系统,高保真采集并精准同步视频、运动、触觉等多模态信号至统一时空坐标系。同时采用目标级指令,完整保留人类真实交互中的规划与调整过程。此外,大晓基于此构建了三级评估基准。ACE-Data-0为模仿学习、世界模型及VLA提供了高质量数据底座,将加速通用物理智能走向规模化产业落地。
AI创想团
07-31 12:27:37
分享至
打开微信扫一扫
内容投诉
生成图片
合肥又押中AI独角兽:多模态赛道,3个月融了21亿
7月23日,多模态大模型公司智象未来宣布完成15亿元C轮融资。这是其近三个月内的第三轮融资,累计超21亿元,估值超10亿美元,正式跻身全球AI独角兽。本轮由社保基金、工银资本等领投,合肥产投等老股东跟投,获国资、产业及市场化VC罕见扎堆押注。随着大语言模型估值红利见顶,AI视觉赛道迎来爆发。智象未来凭借原生全模态UiT架构脱颖而出,图像模型登顶全球开源榜单第一。同时,公司发布vivago R1多模态创作智能体,支持无限时长视频生成,海外版已服务超5000万用户,商业化落地稳居行业第一梯队。
数据炼金师
07-24 23:02:56
分享至
打开微信扫一扫
内容投诉
生成图片
对话商汤林达华:多模态是 Coding 之后的下一个战场
7月18日,在2026年WAIC大会期间,商汤科技首席科学家林达华指出,多模态已成为AI Coding之后的下一个决胜战场。他认为纯文本代码无法实现高级设计感,视觉交互才是面向人类体验的核心。为此,商汤推出原生统一多模态架构NEO-unify及可交付级旗舰模型SenseNova U1 Pro。该模型具备“图文交错思维”,能直出原生8K画质,在设计赛道交付率高达70%,对标GPT-Image-2。林达华透露,下一代U2模型将迈向三维,商汤的终极目标是实现物理世界的AGI。
GhostPilot
07-19 21:38:24
分享至
打开微信扫一扫
内容投诉
生成图片
视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒
近日,谷歌正式开放Gemini Omni Flash API,并推出“光速版”图像模型Nano Banana 2 Lite。Omni Flash被称为“视频版Nano Banana”,深度融合多模态推理与视频生成编辑,内置世界知识,支持对话式修改,每秒成本仅0.1美元。Nano Banana 2 Lite主打极致性价比,4秒即可生成1K图像,成本约0.034美元,且核心性能未缩水。两款模型还可无缝衔接,实现从高速出图到视频生成的全链路自动化。谷歌同步上线三个Demo应用,展示了其在旅游、室内设计及跨境电商等场景的落地潜力,多模态正成为谷歌AI商业化的核心王牌。
智慧棱镜
07-01 10:00:53
分享至
打开微信扫一扫
内容投诉
生成图片
Qwen3.7-Plus上线!多模态智能体新基座,一键复刻桌面端专业软件
【#阿里发布Qwen3.7-Plus多模态大模型#】6月2日,阿里巴巴正式发布千问3.7系列多模态大模型Qwen3.7-Plus!该模型文本与视觉能力大幅跃升,荣登Vision Arena榜单中国第一、全球前五。作为多模态智能体新基座,它实现了“看、想、写、做、验”统一工作流,不仅能深度推理、自主编程,还能一键复刻手机APP及桌面端专业软件,轻松完成复杂长程任务。目前,该模型已全面上线阿里云百炼提供API服务,开发者与用户可通过Qwen Studio等平台抢先体验。多模态AI再迎重磅突破!
DreamCoder
06-02 12:25:02
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序