行业新闻、趋势解读与工具动态
据爱范儿报道,2026 年智能眼镜赛道密集发布:谷歌与 Xreal 联合打造的 XR 眼镜 Xreal Aura 已开放预订,搭载高通骁龙 Reality Elite 芯片与 Android XR 系统,95 克重、70 度视场角、双芯片架构,计划秋季在美、英、日、加、韩等地推出,预订价 99 美元(或 299 美元定金)。Snap 也发布了一体化 AR 眼镜 SPECS,132–136 克、51 度视场角、约 4 小时续航,搭载自研 Snap OS,售价 2195 美元。不过爱范儿认为,Android XR + 骁龙 Reality Elite 只是「范式打底」,智能眼镜仍处于野蛮生长期,能「一锤定音」塑造未来智能交互形态的「iPhone 时刻」尚未到来。据 爱范儿 报道整理。
据爱范儿实测,支付宝推出「AI 版支付宝」,内置智能助手「阿宝」,可用一句话调度支付宝内的各类服务。实测中,它能「打开麦当劳小程序帮我下单可乐」、自动收取蚂蚁森林能量、调用高德打车 API 叫车,还支持一句话记账、上传小票或截图自动记账,并能分析消费习惯与恩格尔系数。能力也有边界:在订火车票、值机等场景,「阿宝」能帮你打开 12306,但还不能自动完成全流程。整体上更像把支付宝里高频的「跑腿」动作交给智能体代劳。爱范儿认为,当越来越多 Skill 被统一管理、调度与执行,超级 App 正朝着「Agent OS」的方向演化——这与近期 OpenAI Codex 录制回放、各家争相把 Agent 塞进入口的趋势相互呼应。据 爱范儿 实测报道整理。
据爱范儿报道,国产 AI 创意内容公司演语科技(Evoken)年化经常性收入(ARR)已接近 3 亿美元。2026 年 5 月,集团整体收入同比增速超过 3000%(约 30 倍),公司预计 2026 年底突破 6 亿美元。支撑增长的是三款产品:AI 绘画社区与素材平台 LiblibAI、AI 视频创作平台 LibTV(2024 年 3 月上线,到 5 月月收入已是上线首月的 13 倍以上),以及 AI 设计 Agent「星流」(累计服务用户超千万)。LibTV 已服务近千个短剧团队、影视制作机构、广告公司与品牌客户。资本层面,演语科技完成近 3 亿美元 B+ 轮融资,投后估值超过 20 亿美元——是国内少数已实现规模化营收、且仍高速增长的 AIGC 公司。据 爱范儿 报道整理。
据爱范儿等报道,OpenAI 于 6 月 18 日为 AI 编程助手 Codex 上线「录制回放」(Record & Replay)功能:你只需在电脑上把一套操作正常做一遍,Codex 全程观察学习,随后自动打包成一个可复用的「技能(skill)」,之后在新任务里直接调用。与传统 RPA 录制不同,它生成的不是写死坐标的脚本,而是一份自然语言的 SKILL.md 说明——记录「什么时候用、需要哪些输入、按什么步骤走、做完怎么验证」。回放时由模型结合当前屏幕状态灵活解读执行,因此界面变动时更不易失效,但在复杂多变的流程上仍不能保证 100% 成功。执行中可调用 Computer Use、浏览器操作与已安装插件。该功能随 Codex 应用 v26.616 推送,面向 ChatGPT 付费用户(Plus、Pro、Business、Enterprise、Edu)开放;发布时暂未在欧洲经济区、英国与瑞士上线,OpenAI 未说明原因与时间表。据 爱范儿 报道整理。
据爱范儿报道,2026 世界人工智能大会(WAIC)暨人工智能全球治理高级别会议倒计时 30 天发布会于 6 月 17 日举行。大会将于 7 月 17 日至 20 日在上海举办,分设世博、张江、西岸三大片区,主题为「智能伙伴,共创未来」。发布会公布了大会首个 AI 原生平台「Hi WAIC」App,集成智能活动、供需撮合、垂直内容、圈层社交等功能,并已开启观众注册;同时推出创投、链接、智识、青创、出海五大生态矩阵。据介绍,本届大会计划设 140 余场主题论坛、1400 余位国际嘉宾、超 10 万平方米展览面积、1100 余家企业参展、3000 余项展品,并发布最高奖项 SAIL 奖 TOP30 榜单。据 爱范儿 报道整理。
6 月 17 日,证监会主席吴清在 2026 陆家嘴论坛开幕式上表示,科创板第五套上市标准的适用范围将扩大至人工智能大模型行业。该标准原为未盈利的生物医药企业设计,扩容后将更好适配 AI 大模型「前期投入大、回报后置」的行业特点。据 21 世纪经济报道,目前已有多家头部大模型企业推进上市进程:DeepSeek 完成融资、估值或突破 4000 亿元,智谱已完成上市辅导,MiniMax 已签署辅导协议。政策松绑被视为国产大模型登陆资本市场的重要一步。据 21 世纪经济报道 报道整理。
据量子位报道,具身大脑公司大晓机器人近期完成天使+轮融资,累计融资金额达数亿美元,达晨财智、深创投、上海科创基金、沐曦股份、复星锐正等超 15 家机构参与。大晓走「世界模型」路线——一种能预测「接下来会发生什么」的 AI 大模型,相当于让机器人拥有能「脑补」未来的大脑,采用「理解—生成—预测」一体化架构。半年内,大晓开源了 Kairos 3.0(号称业内首个开源商用世界模型),发布 4B 轻量版实现端侧部署,并推出搭载 30 万套中国真实住宅户型的 Kairos-Homeworld 数字训练场。据 量子位 报道整理。
据量子位报道,专注 3D 架构 AI 云端大算力芯片的算苗科技宣布,其 3D TokenPU 芯片 A4E 已于 6 月 15 日正式流片。该芯片采用 3D 混合堆叠架构,将 8 层存储晶圆垂直堆叠在计算逻辑晶圆之上,通过硅通孔与凸点技术实现微米级互联,提供高达 16TB/s 的访存带宽。A4E 面向大模型推理场景,主打突破「内存墙、算力墙、通信墙」三大瓶颈,并强调基于国产供应链的自主可控,目标是为国内大模型产业提供高性能、高性价比的算力支撑。据 量子位 报道整理。
据 The Information、量子位等媒体报道,国产大模型公司深度求索(DeepSeek)已完成首轮外部融资,募资总额超 500 亿元人民币,刷新中国 AI 公司单轮融资纪录;融资后估值升至 3500 亿至 4000 亿元区间。据报道,创始人梁文锋以自有资金先行投入约 200 亿元,约占本轮融资的四成,腾讯、宁德时代等机构亦在参投之列。与融资同步,DeepSeek 新一代模型 V4.1 计划于 6 月推出。截至发稿,DeepSeek 未就上述融资细节作出官方置评,相关数字以媒体报道为准。据 量子位 报道整理。
据证券时报报道,上海燧原科技股份有限公司首发申请于 6 月 15 日获上交所上市委会议通过。燧原科技围绕自研云端 AI 芯片,构建了覆盖 AI 加速卡及模组、智算系统及集群的全栈算力产品体系,并通过自研软件平台「驭算 TopsRider」实现软硬协同优化。据招股材料,公司拟发行约 6835 万股、募集资金 60 亿元,主要投向五代及六代 AI 芯片系列产品研发及产业化、人工智能软硬件协同创新等项目。2023 至 2025 年公司营收分别为 3.01 亿、7.22 亿、9.90 亿元,净利润仍为亏损但幅度逐年收窄。据 证券时报 报道整理。
2026 年被普遍视为企业级 AI Agent 落地的转折点。越来越多团队不再满足于对话式助手,而是把 Agent 接入工单、CRM、数据库,让它真正完成多步骤任务。从单点到工作流头部厂商相继开放工具调用与长任务编排能力,Agent 可在一次会话中跨多个系统取数、决策、回写,人类只在关键节点确认。实测中,规范的权限边界与可观测的执行轨迹,是企业敢于把 Agent 放进生产流程的前提。
据报道,AI 智能体正从分钟级演示走向天级自主执行:Cursor Agent 单任务运行时长可达 36 小时,Claude Code 的单日提交量已占全球 GitHub 公开代码相当比例,预示软件开发范式的转变。据 CSDN 报道整理。
最新一批多模态模型在「跨模态对齐」上取得明显进步,能同时理解一段视频里的画面、语音与字幕,并据此回答复杂问题。应用想象空间从视频内容审核、会议纪要到无障碍辅助,统一的多模态理解正在打开一批此前难以自动化的场景。
随着多个高质量开源权重发布,中小团队以更低成本自建推理服务的可行性大幅提升。在「够用 + 可控 + 数据不出域」三重诉求下,开源模型在企业内网部署中的占比持续上升。
据报道,Anthropic 年化运营收入已突破 470 亿美元,较此前 G 轮融资时大幅增长,AI 商业化进程显著提速,三大模型厂商竞争持续升温。据 OFweek 报道整理。
我们用一组真实仓库的缺陷修复任务横评主流 AI 编程助手,发现「读懂上下文 + 跨文件定位」才是拉开差距的关键。结论速览补全体验趋同,差异主要体现在长上下文检索、测试驱动修复与对项目约定的遵循程度上。
国产开源模型 DeepSeek V4 在代码与数学能力上表现突出,SWE-bench Verified 得分达 80.6%,位列开放权重模型顶尖水平,且 API 价格极低,受到中小团队青睐。据 博客园 报道整理。
随着推理优化与竞争加剧,主流 AI 视频生成的单位成本较半年前明显下降,短视频创作者的试错门槛随之降低。画质与一致性持续改善的同时,「提示词友好度」成为中文创作者选型的重要考量。
OpenAI 发布最新旗舰模型 GPT-5.5,主打更快的速度与更强的复杂任务处理能力,面向编程、研究、数据分析等场景,已向 Plus、Pro、Business 与 Enterprise 用户开放。据 OpenAI 报道整理。
围绕生成内容标识、训练数据来源披露与可解释性的讨论持续升温,合规正从「加分项」变为「入场券」。对工具方而言,提前建设审计日志与内容溯源能力,有助于在 To B 市场建立信任。
我们用同一组提示词实测了多款主流 AI 视频生成工具,从画质、运动一致性、提示词遵循三个维度做了横向对比,本文附实测视频与截图。 实测视频 同一提示词下的生成效果对比(示例视频) 画面表现 从静帧画质看,第一梯队工具在光影与材质细节上已经接近实拍素材;人物面部与手部仍是普遍弱项。 运动一致性 长镜头下的主体一致性差距明显:部分工具在 10 秒以上的镜头中会出现主体漂移。 B 站完整版 结论 追求电影感:优先 Runway、可灵 中文提示词友好:即梦、可灵 性价比之选:关注各家免费额度的刷新规则
Google 的 Gemini 3 Pro 可一次性处理极长的视频、音频与文档,并直接调用 Google Docs、Gmail、Drive 中的资料,显著强化办公场景下的多模态能力。据 知乎 报道整理。
OpenAI 大幅强化 ChatGPT 的 Code Interpreter:从过去的数据分析与图表生成,升级为可直接读取、修改并运行多语言完整项目文件,开发者工作流进一步自动化。据 CSDN 报道整理。