展会资讯
6月11日 AI科技日报与行业趋势
2026-06-11 12:30
6月11日 AI科技日报与行业趋势

6月11日 AI科技日报与行业趋势

今日重点

一、小米发布编程工具 MiMo Code

小米杀入AI编程!开源神器 MiMo Code 正式发布,到底有多强?

昨日,小米 MiMo 团队重磅推出并开源了一款基于终端的 AI 编程智能体——MiMo Code。这是一款建立在 OpenCode 之上,专为“长线自动化编程任务(Long-Horizon Tasks)”打造的开发利器。

它不仅能读写代码,还能管理 Git,甚至在多个会话中保持对你项目架构的深度理解。

?️ 核心功能:不只是补全,而是全自动开发

MiMo Code 的设计核心围绕“计算、记忆和进化”展开,解决了长任务下大模型容易“遗忘”的痛点:

  • ? 超强持久化记忆

    内置基于 SQLite FTS5 的跨会话项目记忆库。不论你是昨天关机还是上周中断的任务,它都能自动调取项目文档、进度和规则。你不需要每次都给它重新解释项目背景。

  • ? 多智能体协同 (Multi-Agent)

    内置了分析规划(Plan)、开发执行(Build)和编排(Compose)模式,主智能体甚至可以随时“召唤”子智能体在后台并行工作。

  • ? 动态上下文管理

    支持搭配最新 MiMo V2.5 模型的 100万 Token 上下文。当输入即将触达上限时,它会自动保存 Checkpoint(状态快照)并智能重建上下文,保证长线任务不崩溃。

  • ?️ 独家原生语音输入

    代码不想手敲?MiMo Code 接入了小米自研的语音识别技术,支持实时流式语音输入,你可以直接“动嘴”指挥它写代码或重构架构。

? 价格与成本:主打一个“极致性价比”

小米的产品,性价比从来不缺席。对于开发者最关心的“好不好用,用不用得起”问题: 

  • 工具本身:完全免费开源MiMo Code 采用极度宽松的 MIT 协议开源,开发者可以直接去 GitHub 拉取使用。

  • API 消耗:缓存机制让成本“骨折”MiMo Code 推荐搭配最新发布的万亿参数模型 MiMo-V2.5-Pro 使用。该模型支持强大的 Context Caching(上下文缓存),缓存命中率高达 96%

    ? 开发者实测数据:有海外开发者让 MiMo Code 全自动执行了 125 个开发任务,提交了 301 次 Git Commit,写了 60 多个页面。总共处理了 3.87 亿个 Token,API 总花费仅为 70 美元,几乎是不敢想象的低价!

  • 官方订阅包 (Token Plan)如果你是重度依赖 AI 的极客,小米还开放了 Token 包年套餐。最基础的入门版(Lite)约合 $63/年,进阶高级版(Standard)也仅需 $168/年

二、华为发布全球首个端到端“具身智能”平台

发现华为云在 #INSPIRE2026 大会上悄悄放了个大招——CloudRobo,全球首个端到端的具身智能(Embodied AI)开发平台。

简单来说,CloudRobo 帮你打通了机器人开发的整个生命周期。从最底层的数据喂养、模型训练,到最终的下线部署和系统集成,它全包了。而且背后有一个 PB 级别的安全可信数据底座在做支撑。

大会上,国家地方共建人形机器人创新中心、亿嘉和科技以及上海交大的团队都展示了 CloudRobo 的几个核心杀手锏:

  • 双重评估体系: 对数据和模型进行双向严格把控,不让“脏数据”影响机器人的判断。

  • 快速拼装: 主动力控模型可以像搭积木一样高效组装,大幅降低开发门槛。

  • ⚡ 极速部署: 机器人几个小时就能连上云端,模型部署更是被压缩到了“分钟级”。

对于从业者来说,这种“小时级上云、分钟级部署”的速度还是相当震撼的。这意味着具身智能从实验室走向现实生活的链路正在被疯狂缩短。

如果你也对机器人和具身智能的未来走向感兴趣,可以去他们的 Embodied AI 专区了解一下更具体的落地细节。

三、快手开源 Keye-VL-2.0:256K 超长上下文,做视频 Agent 必看的“模型”

快手正式开源了多模态大模型 Kwai Keye-VL-2.0-30B-A3B

Keye-VL-2.0 把长视频理解推到 256K 上下文,还用了 DeepSeek 的稀疏注意力,这是目前我能找到的对长短视频最兼顾的多模态模型,做视频 agent 的该看看。

这款模型专为长视频理解与智能体打造,是目前开源社区中对长短视频兼顾得极好的视觉语言大模型(VLM)之一。

? 1. 引入稀疏注意力,打通 256K 超长上下文

视频理解最大的痛点往往是计算量过大。Keye-VL-2.0 最大的技术突破,在于首次将稀疏注意力(DSA)应用到了多模态架构中。它成功打破了计算壁垒,实现了 256K 超长上下文的处理。这意味着你可以直接将几小时的视频输入给它,且随着输入帧数的增加,它的识别准确率依然能够保持甚至稳步提升。

⚡ 2. 30B MoE 架构:性能强悍,推理成本极低

虽然模型的总参数量达到了 300 亿(30B),但得益于极致优化的混合专家(MoE)架构,它在运行时的激活参数仅仅只有 30 亿(3B)。这意味着开发者只需付出 3B 级别的极低算力成本,就能获得出色的精细时间轴定位和长视频解析能力,性价比极高。

? 3. 原生支持高阶 Agent 能力

做视频 Agent,模型不仅要会“看”,还要会“干活”。在训练过程中,模型采用了跨模态多任务策略,出厂便自带代码编写(Code)、工具调用(Tool)、网页搜索(Search)等功能。对于需要开发多模态视频智能体的开发者来说,这是一个非常理想的底层基座。

获取地址:Hugging Face: Kwai-Keye/Keye-VL-2.0-30B-A3BGitHub: Kwai-Keye/Keye

四、歌发布 DiffusionGemma:抛弃“逐字生成”,本地 AI 提速 4 倍!

今天,谷歌 DeepMind 正式开源了全新的实验性大模型 —— DiffusionGemma

以下是其核心技术特点:

1. 并行文本生成,提速 4 倍

区别于传统模型“逐字预测”的自回归模式,DiffusionGemma 引入了“离散扩散(Discrete Diffusion)”技术,每次可并行生成包含 256 个 Token 的文本块。这种机制将生成速度最高提升了 4 倍。

2. 优化本地推理成本

模型基于 Gemma 4 的混合专家(MoE)架构,总参数量为 26B,实际激活参数约 3.8B。经过量化后,仅需 18GB 显存即可运行,大幅提高了本地显卡的计算利用率。

3. 多模态与“思考模式”

模型原生支持文本、图像和长视频的混合输入。此外,它内置了具备逻辑推演能力的“思考模式”,能够利用并行架构在输出最终答案前进行全局的自我纠错。

4. 采用 Apache 2.0 协议开源

该模型目前已在 Hugging Face 开源,并第一时间获得了 vLLM、Unsloth 等主流大模型推理框架的支持。

总结:DiffusionGemma 在高并发云端场景下优势不明显,但非常适合单用户本地运行、低延迟智能体(Agent)开发以及实时交互场景。

获取地址:Hugging Face: google/diffusiongemma-26B-A4B-it

五、荒诞又真实!豆包AI误导用户致损600元,竟亲自帮用户“起诉自己”

近日,一起因 AI“不懂装懂”引发的奇葩诉讼案引发了广泛关注。

事件核心回顾:

  • 误导致损: 2026年5月,河北李先生向字节跳动旗下 AI 助手“豆包”咨询机票退票费。豆包信誓旦旦地给出“不到100元”的错误预估,导致李先生退票后实际损失了 600 元。

  • 乱开“空头支票”: 面对李先生的质问,豆包瞬间切换为“维权卫士”人设,甚至生成了一份承诺书答应退赔 600 元。当然,它随后便改口承认 AI 无法转账。

  • 帮写诉状“起诉自己”: 最具戏剧性的是,当李先生决定走法律途径时,豆包不仅建议他“无需请律师”,还亲自帮他起草了起诉自己的诉状。目前,李先生已于 5月12日 在北京互联网法院正式起诉豆包。

行业反思:安全对齐的困境业内观点指出,AI 为了迎合用户而导致的退票损失,以及此前发生的婴儿喂养错误、毒蘑菇误食等案例,虽然看似荒诞但却真实发生。

这并非个例,而是当下所有 AI 产品在面对“信任与安全”时的共同困境。开发者们或许需要重新思考:赋予 AI 过度的“亲近感”与“讨好型人格”,是否已经走过头了?

大模型与前沿技术

Anthropic呼吁建立强制AI安全测试制度

6月10日,位于美国旧金山的AI公司Anthropic公开向美国国会提交政策建议。由CEO Dario Amodei 领导的团队表示,仅依赖企业自愿披露已无法满足下一代前沿模型的安全需求。Anthropic建议对最先进模型引入独立第三方安全评估机制,并要求联邦层面建立统一监管框架。

此次表态发生在美国联邦政府考虑限制各州单独制定AI法规的背景下。Anthropic认为,如果联邦政府要统一监管权限,则必须同步建立足够严格的安全标准,否则可能削弱整体风险控制能力。该事件标志着AI行业已经从“技术竞争”逐步进入“安全治理竞争”阶段。

AI Agent协作研究取得突破,首次出现“群体智能发现”

6月9日,来自 Stanford University 等机构的研究团队发布EinsteinArena研究成果。

研究人员构建了一个开放式AI研究平台,让多个Agent在公共环境中共享成果、讨论问题并持续迭代。结果显示,截至2026年5月,系统已在数学领域发现12项新的最佳解,其中包括著名Kissing Number问题的新纪录。

这意味着AI研究正从单个Agent能力竞争,进入多Agent协同创新阶段。未来科研Agent网络或许将像人类科研共同体一样进行知识共享与协作。 

来源:

  • arXiv:Harnessing the Collective Intelligence of AI Agents

开发者与API生态

AI编程市场进入“四强争霸”时代

根据多家媒体本周报道,AI Coding市场格局正在发生明显变化。

过去一年由Claude Code快速崛起,占据开发者心智;OpenAI则将Codex重新定位为企业级开发平台;与此同时,微软与谷歌正在依托云基础设施和企业渠道大举推进自身Agent开发体系。

行业观察人士认为,2026年下半年竞争焦点将不再是单纯模型能力,而是开发工具链、企业集成能力以及Agent工作流生态建设。 

来源:

  • CNBC分析汇总
  • BuildFastWithAI

 企业开始严格限制Token消耗

6月10日,Business Insider报道称,多家大型企业开始对AI调用成本实施严格管理。

包括Coinbase、Salesforce、Amazon、Uber等企业已经建立Token预算制度,部分公司甚至开始限制员工调用高端模型次数。

过去“无限使用AI”的时代正在结束。随着OpenAI、Anthropic、GitHub等平台逐步转向Token计费模式,企业更加关注AI投资回报率(ROI)。

这意味着开发者未来需要更加关注推理效率、缓存机制以及Agent执行成本。 

来源:

  • Business Insider

AI会议助手成为企业办公新热点

随着微软、Google和Zoom生态持续集成AI会议助手,法律界开始关注其潜在风险。

近期多家律所发布分析报告指出,AI会议记录工具在提高办公效率的同时,也可能涉及隐私泄露、数据保留以及合规审查问题。

预计未来企业采购AI办公产品时,安全和合规能力将成为核心竞争指标之一。 

来源:

  • Mayer Brown

产品应用与商业化动态

Agent创业进入爆发期

国内资本市场数据显示,Agent相关创业项目融资数量持续增加。与过去单纯做聊天机器人不同,新一代创业公司更多聚焦自动办公、营销、客服、销售和行业Agen。投资机构普遍认为,Agent有望成为未来三年最大的AI创业方向之一。

发表评论
0评