首页/每日资讯/【每日简讯】每周AI信息参考|“AI友好型”媒体技术规范发布/
【每日简讯】每周AI信息参考|“AI友好型”媒体技术规范发布
2026-09-03 15:35:575浏览
【9月1日更新】

“AI友好型”媒体技术规范发布

在8月28日晚数博会“DATA之夜”活动现场,《生成式人工智能友好型媒体技术规范》框架正式发布。该《规范》框架旨在推动媒体高价值数据资源结构化、知识化,加强本体体系与知识图谱建设,使内容具备更强的智能理解和应用能力,从而实现媒体内容从“被用户看到”到“被AI系统读懂”,真正实现内容价值在智能时代的最大化释放。《规范》框架采用“1+N+X”开放式架构,即1个主标准、N个子标准、X个场景化附件,目前已完成主标准和四个子标准、四个场景化附件的编制。主标准《生成式人工智能友好型媒体技术规范》是体系总纲,确立AI友好型的技术架构、内容生产的语义规范、安全可信和评价体系,为工程落地提供基础指引。四个子标准是体系的细目,其中,《媒体采编过程数据采集与管理技术规范》为媒体策、采、编、审、校、印、发、播、评的采编全流程,规范标准元数据;《主流价值语料库建设与评价技术规范》规范采集清洗、标准规范、安全审核和价值对齐体系;《媒体应用A2A/AIP协议适配技术规范》统一A2A、AIP协议适配要求,打通多智能体平台间安全高效的交互通道;《媒体报道知识本体建设与评价规范》为 AI 深度理解内容提供技术规范,规范本体体系和知识图谱建设。四个子标准从数据、语料、智能体、知识四个维度,支撑主标准落地。而场景化附件则为不同媒体形态提供了可操作的实施指南。《规范》框架由人民日报社技术部、传播内容认知全国重点实验室、中国报业协会联合编制。目前,该系列规范已在人民日报“AI友好型”主流价值服务平台应用,并正式向全国数标委提交国家标准立项申请,主标准和《主流价值语料库建设与评价技术规范》已率先通过初评。


字节跳动发布豆包工作

8月25日,字节跳动正式推出面向生产力场景的全新Agent产品豆包工作。作为一款企业级智能体,豆包工作能够围绕用户目标自主拆解任务、调用工具,持续推进复杂工作流程。豆包工作基础办公能力覆盖方案撰写、会议纪要整理、报告起草、调研总结、表格制作、数据分析等高频场景。针对长周期复杂任务,经用户授权,豆包工作可操控浏览器与本地电脑,跨软件完成网页信息搜集、资料比对、表单填报、专业软件数据处理等操作,可调度云电脑后台持续运行,并支持手机远程操控。豆包工作与飞书深度打通,飞书账号可在授权范围内调用聊天记录、文档、会议纪要、日程等企业上下文,结合相应工具完成工作。


阿里千问Qwen3.8-Flash开源

8月26日晚,阿里通义千问团队发布并开源多模态混合专家(MoE)模型Qwen3.8-Flash,千亿总参数仅激活60亿(6B),创下模型效率新基准。该模型采用全新架构,引入自研稀疏注意力机制QSA(Qwen Sparse Attention),形成与线性注意力架构GDN(Gated DeltaNet)融合的混合注意力架构,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上。在模型内部分层通信方面,该模型引入自研的Gated Residual方法,将残差流扩展为4条并行分支,通过动态Gate控制信息读写。在模型参数扩展方面,引入51B的N-gram Embedding参数,为模型Transformer参数提供更高效的查表寻址。


智谱上线GLM-5系列首个原生多模态模型

8月26日,智谱宣布上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型。GLM-5.3-Flash拥有3200亿总参数,每次推理激活180亿参数。GLM-5.3-Flash采用线性注意力与稀疏注意力结合的混合方案,并引入流形约束超连接(mHC)。模型使用30万亿tokens的多模态语料进行预训练,支持约100万tokens上下文,可接收文本、图像和视频输入并输出文本。智谱基于SGLang搭建面向国产加速芯片的推理引擎,并采用编码、预填充和解码分离的EPD架构。


Gartner:物理AI正在成为中国市场新的关注方向

近日,Gartner发布2026中国数据、分析和人工智能技术成熟度曲线。Gartner称,AI智能体热度已经超过生成式AI,进入期望膨胀期并成为企业关注重点;物理AI正在成为中国市场新的关注方向。Gartner认为,AI项目能否成功正越来越取决于数据就绪度、治理机制、安全护栏和工程化能力等基础建设,这些支撑能力的重要性已经超过AI模型技术本身。在物理AI方面,Gartner将其定义为以物理形态存在、能够感知并与真实世界交互的AI系统,包括机器人、无人机、自动驾驶车辆和智能设备等。此类系统将传感器、控制系统与AI模型结合,从而实现对物体的操作、空间移动以及对动态环境的自主响应。Gartner此次还重点关注了前沿部署工程师(FDE)。这一岗位通常直接进入客户业务场景,通过工程能力、行业知识和产品反馈,将客户需求转化为技术方案。Gartner认为,个人智能体将推动AI从以对话为主的工具向能够执行复杂任务的系统转变。对于大语言模型(LLM),Gartner认为其仍是生成式AI发展的核心基础技术之一,可用于问答、内容及代码生成、深度研究和智能体等任务。


谷歌推出Gemini Omni 1.1 Flash视频生成模型

当地时间8月27日,谷歌宣布推出Gemini Omni1.1Flash视频生成AI模型,输出分辨率可选1080P或4K。其功能设计包括场景扩展、运镜控制、生成参考视频片段等。场景扩展功能允许用户在已有视频结尾处无缝衔接并生成后续画面,每次扩展步长为10秒,累计最长时长可达40秒。运镜控制通过指定镜头的起始帧与结束帧,实现平滑自然的转场效果与专业运镜。新模型支持引入最长3秒的参考视频片段,从而在构建新场景时精准维持画面的上下文背景与角色一致性。


Midjourney发布图像编辑模型

日前,Midjourney正式发布V8.2图像编辑模型。Midjourney V8.2引入了图像编辑能力,包括指令编辑、多图参考(单词最多同时融合4张图片)、局部重绘和画布扩展功能,兼容个性化设置、情绪板及风格参考。用户可通过拖拽图片至提示框、点击预览灯箱编辑按钮、左侧导航栏编辑标签或Discord指令等方式使用。指令编辑能力允许用户通过文本指令直接修改图像。对创作者来说,这意味着从单次生成转向对已有图像的灵活修改,视觉创作的控制精度有所提升。


比尔·盖茨发长文呼吁关注AI风险

日前,微软联合创始人比尔·盖茨在其个人网站发表长文,分析人工智能对就业、财富分配、教育、医疗、安全乃至社会制度的影响,呼吁加强AI监管。比尔·盖茨认为,AI可能成为“有史以来最伟大的平等促进器,也可能成为最严重的不公正之源”,这次转型不同于过去的技术变革,因为人工智能发展的速度以及其潜在影响的规模都非同寻常。AI不仅会提高生产率,也可能以前所未有的速度替代认知劳动、重塑财富分配,甚至冲击现有税收和社会保障体系。比尔·盖茨还提出了设置人类保留岗位等思考。

来源:人民网


编辑:许多、韩佳琪(实习)

责编:岳禺宁

友情链接: