Liquid AI发布d1系列开放权重决策模型
10月7日,美国AI公司Liquid AI正式推出d1系列两款开源决策模型: d1-3B(31.2亿参数,支持文本与图像)和d1-omni-600M(5.87亿参数,支持文本、图像及语音多模态输入)。两模型均已在Hugging Face平台开源,可供下载、微调与部署。d1-3B在Decision Index v0.2.1测试中得分48.57,领先同类10B以下模型;d1-omni-...
10月7日,美国AI公司Liquid AI正式推出d1系列两款开源决策模型: d1-3B(31.2亿参数,支持文本与图像)和d1-omni-600M(5.87亿参数,支持文本、图像及语音多模态输入)。两模型均已在Hugging Face平台开源,可供下载、微调与部署。d1-3B在Decision Index v0.2.1测试中得分48.57,领先同类10B以下模型;d1-omni-...
[太平洋科技快讯]据 IT 之家报道,9 月 4 日,微信 AI 官方宣布开源通用多模态嵌入模型 WeMM-Embedding,该模型包含 2B、4B、9B 三种参数版本,以 Qwen3.5 多模态架构作为基础骨干网络,支持文本、图片、视频、视觉文档以及多种模态交错混合输入。图源: 微信 AI,下同在国际权威评测榜单 MMEB-v2 当中,WeMM...
2026年9月4日,微信AI宣布开源通用多模态嵌入模型WeMM-Embedding。该模型含2B、4B、9B三个版本,基于Qwen3.5架构,支持文本、图像、视频及视觉文档等任意组合输入。其9B版本在MMEB-v2榜单以80.6分居首,2B版达77.9分,超越此前领先8B开源模型。目前模型已部署于微信视频号、直播、公众号等核心场景,日均调...
2026年9月2日,月之暗面宣布Kimi API正式支持OpenAI Responses API格式(base_url: https: //api.moonshot.cn/v1)及Anthropic Messages API格式(base_url: https: //api.moonshot.cn/anthropic)。此举面向Codex和Claude Code用户,无需格式转换或本地代理即可直连kimi-k3、kimi-k2.7-code-highspeed等模...
2026年8月27日,英伟达宣布以129亿美元收购开源人工智能模型平台Hugging Face。总部位于纽约的Hugging Face以推动AI democratization著称,提供模型共享、推理和聊天机器人开发工具,支持文本、图像及表情包等多模态交互。此次收购旨在强化英伟达在生成式AI生态中的平台能力与开发者协同优势。交易预计...
[太平洋科技快讯]据每日经济新闻报道,近期一款匿名 AI 模型 Ox Alpha ( 中文社区被称作"牛来" ) 登陆 OpenRouter 平台之后调用量快速走高,短时间登顶平台榜单,刷新该平台的单日模型调用纪录。根据 OpenRouter 数据显示,仅 Hermes Agent、Claude Code 等前五款应用,对 Ox Alpha 的累计调用量就突破 4 ...
8月20日,全球AI聚合平台OpenRouter上线匿名模型Ox Alpha,免费开放一周。该模型在DeepSWE基准测试中达80%准确率,显著高于Claude Fable 5(65%)和GPT-5.6-sol(52%)。其上下文窗口达104.9万token,支持文本、图像、视频多模态输入,单次响应最高输出13.1万token。多项技术分析(分词器指纹、视频编码器行为...
8月12日,千问AI平台正式上线AI Agent挑战与评测平台'千问AI Arena'。该平台面向开发者,提供模型、运行环境及多模态评测能力,首个任务由千问AI与Aidge联合发起,聚焦跨境电商商品上架场景。平台采用机器评测与专家评审双轨机制,机器评测引擎支持文本、图片、视频等多模态内容的业务契合度分析,预计8月...
7月24日,科技媒体Cult of Mac报道称,苹果在即将发布的iOS 27系统中引入智能粘贴快捷按钮。用户复制文本、网页链接或图片后,切换至输入界面(如备忘录、信息等),该按钮即显示于键盘上方,点击一次即可完成粘贴。功能覆盖Safari链接、Reddit图片等多场景,并基于上下文自动识别粘贴意图。该特性面向iPhone...
2026年7月20日,谷歌DeepMind发布GenCeption模型,将预训练视频生成器逆向改造为多任务视觉分析引擎。该模型基于通义万相Wan2.1系列,仅用7500段合成视频训练,单次前向传播即可完成深度估计、图像分割、3D姿态估计等五类任务。其支持文本提示驱动,可输出深度图、表面法线图及分割掩码,并具备跨域泛化能...
7月17日,阿里巴巴ATH事业群宣布即将推出AI音乐创作平台"HappyShrimp"(中文名"快乐虾米")。该平台主打"一句话生成专属音乐",支持文本生成音乐/歌词、参考音频生成、风格转换等功能,面向音乐创作者、制作人、科研人员及自媒体、影视从业者等群体。产品拟上线App并首发海外,目前尚未开放使用权限。此举...
2026年7月12日,阶跃星辰正式推出Step Edge端侧模型全家桶,涵盖基础模型、Audio、GUI和Gen四款产品。该系列面向手机、汽车等终端设备,旨在推动AI Agent从云端下沉至本地。其核心优势包括: 端侧toolcall延迟低至0.1秒;支持文本、视觉、语音全模态本地处理,保障隐私;实现原生端云协同,平衡响应速度、...
2026年6月25日,科技媒体9to5Mac报道,iOS 27新推出的独立Siri应用默认调用苹果自研AI,但用户可长按输入框选择切换至ChatGPT。该应用采用聊天界面设计,支持文本输入、图片及文件上传、历史对话查看等功能。切换仅限Siri与ChatGPT两选项,且每次重启应用后默认恢复为Siri AI;当前设置中尚不支持将ChatGP...
2026年6月11日,微软宣布放宽Windows 11本地语言模型API使用限制。此前该功能仅限搭载40 TOPS以上NPU的AI+ PC设备,现扩展至英伟达GeForce RTX 30系列及更新显卡(显存≥6GB)。API由轻量级模型Phi Silica驱动,通过Windows Update自动下载并利用GPU本地推理,支持文本格式化、摘要、改写、转表格及提示词...
2026年6月8日起,字节跳动旗下火山引擎推出Agent Plan与Coding Plan限时优惠活动,持续至8月27日。新购、升级或续费40元及200元档位用户,可享首两月2.5折(Lite/Small档9.9元/月,Pro/Medium档49.9元/月),第三个月起恢复原价。两款套餐均集成MiniMax M3、DeepSeek V4、GLM-5.1等前沿模型;其中Agent Plan...
2026年6月1日,英伟达正式推出面向物理人工智能的全开源多模态基础大模型Cosmos 3。该模型采用混合Transformer架构,原生支持文本、图像、视频、环境音效及动作生成与理解,显著提升物理仿真精度。其训练基于数十亿多模态样本,可将物理AI训练周期从数月缩短至数日。同步成立NVIDIA Cosmos联盟,联合Agile...
2026年5月29日,阿里云宣布百炼核心能力正式CLI化。开发者仅需一行命令,即可让AI Agent接入其150余款模型、十余款应用及知识库、记忆、联网搜索等全套能力。该CLI专为Agent设计,原生兼容Claude Code、Qoder等主流框架,已开源至GitHub。支持文本、图像、视频、语音、视觉理解等多模态调用,以及Workflow...
语音人工智能公司 ElevenLabs 近日正式上线其独立移动应用,iOS 与 Android 用户现已可在移动端便捷地将文本转化为语音片段。此前该功能仅限于网页端操作,如今用户可随时随地生成所需音频内容。只需输入或粘贴文本并选择语音模型,即可完成语音合成。免费用户享有约10分钟的音频生成时长,并可在不同音...
阿里云今日凌晨推出新一代端到端多模态模型Qwen2.5-Omni,并在Hugging Face、ModelScope等平台开源。该模型采用创新的Thinker-Talker架构,能无缝处理文本、图像、音频和视频输入,并实时生成文本及语音输出。Qwen2.5-Omni通过TMRoPE技术实现音视频精准同步,在实时交互与语音生成方面表现优异。测试显示...
金山办公旗下WPS宣布会员体系全新升级,原「WPS会员」、「稻壳会员」及「超级会员」合并、升级,推出全新的「WPS超级会员」,并提供基础和Pro两个套餐。WPS还剧透将推出WPS+AI。WPS+AI也能够对已有文案进行加工和再处理包括: 编辑、改写、扩充、缩短、润色等。