• chinamm2026@163.com

大会特邀报告


张文军

中国工程院院士,上海交通大学讲席教授

个人简介:张文军,中国工程院院士,上海交通大学讲席教授,未来媒体网络协同创新中心主任。长期从事图像编码与通信、媒体网络融合、宽带无线传输、数字电视核心芯片等领域技术研究。三十年来致力于构建我国电视广播与媒体网络领域自主技术体系,率团队承担多项国家重大科研与工程任务,取得系统性创新成果。以第一完成人获得国家科技进步二等奖四项、中国专利金奖一项、何梁何利科技进步奖和上海市科技功臣奖等荣誉。

报告题目:生成式媒体网络

报告摘要:生成式人工智能正在深刻重塑媒体的制作、传输与呈现形态。本报告探讨生成式媒体表征与通信的新范式,提出构建双流驱动的媒体表征形态。通过在可靠性边界内引入生成自由度,利用生成模型释放前所未有的视觉表达能力与通信效用,旨在构建可变、可控、兼容的新一代媒体网络体系。报告最后将结合团队近期在超低码率媒体编码与传输领域的探索与实践,分享相关技术演进路径。




吴枫

中国工程院院士,中国科学技术大学杰出讲席教授

个人简介:吴枫,中国工程院院士、中国科学技术大学杰出讲席教授,类脑智能技术及应用国家工程实验室主任,合肥综合性国家科学中心人工智能研究院执行院长,深空探测全国重点实验室副主任。从事网络流媒体研究近三十年,是我国在该领域的学术带头人。针对互联网中海量媒体实时流畅传输的巨大挑战,他建立了网络流媒体的非均匀率失真理论,攻克了图像视频高效压缩和压缩数据适配传输两大技术难题,牵头制定了IEEE数据压缩系列标准,研制了国际首个大规模应用流媒体系统的高效编解码器,在网络流媒体的技术创新支撑了华为麒麟芯片的开发,解决了神舟飞船和探月工程中媒体传输的关键技术难题。出版英文学术专著2部,发表IEEE期刊和CCF A类论文280余篇,谷歌学术引用39000余次,H指数98,授权中、美发明专利230余项。获国家自然科学二等奖1项(序1)、国家技术发明二等奖2项(序1、3)和何梁何利科学与技术进步奖,主持基金委杰青和创新群体项目。当选IEEE Fellow,任视频领域顶级期刊IEEE TCSVT主编和IEEE数据压缩标准委员会主席,在网络流媒体领域具有重要国际影响力。

报告题目:面向精准医疗的新型成像技术

报告摘要:当前精准诊疗面临"看得见但看不准""看得清但看不全""技术先进难落地"等瓶颈,统筹高端成像设备研制和新型成像技术开发,是实现生命全景信息可视化、推动生命医学实现重大突破的核心路径。人工智能研究院正在建设国内领先、世界一流的多模态、跨尺度、多组学成像设施集群,围绕高端成像设备研发、精准诊疗等方向进行系统布局,在三维分子病理成像、空间转录组成像、空间代谢组成像、全数字PET成像等方面取得关键突破并实现产业化落地,覆盖从分子微观到活体宏观跨尺度观测,涵盖结构、转录、代谢、功能多个组学信息,结合AI智能分析,为重大疾病精准诊疗提供全套自主可控的国产成像技术支撑。




陈长汶

欧洲科学院院士,香港理工大学视觉计算讲座教授

个人简介:陈长汶教授现任香港理工大学视觉计算讲座教授。在此之前,他于2017年至2020年担任香港中文大学深圳分校理工学院院长,并于2018年至2021年兼任鹏城实验室副主任。此前,他于2008年至2021年担任纽约州立大学布法罗分校Empire Innovation讲席教授,并于2003年至2007年担任佛罗里达理工学院艾伦亨利讲席教授。他于1983年获得中国科学技术大学学士学位,1986年获得南加州大学硕士学位,并于1992年获得伊利诺伊大学厄巴纳-香槟分校(UIUC)博士学位。他目前担任IEEE图像处理汇刊的副总编辑,并曾担任IEEE多媒体汇刊(2014-2016)和IEEE视频技术电路与系统汇刊(2006-2009)的总编辑及多个国际顶尖期刊的编辑。他荣获多项专业成就奖,包括十项最佳论文奖或最佳学生论文奖,并于2010年获得享有盛誉的亚历山大·冯·洪堡奖、2016年获得纽约州立大学校长卓越学术与创意活动奖、2019年获得伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系杰出校友奖、以及2024年获得ACM SIGMM终身学术成就奖。他是IEEE会士、SPIE会士和欧洲科学院院士。

报告题目:人工智能生成的视觉艺术内容:从创作到美学推理

报告摘要:生成艺术的飞速发展使视觉艺术内容的创作大众化。然而,要达到真正的艺术冲击力,即能够与观众产生更深层次、更有意义的共鸣,则需要一种精深的审美感知。这种感知涉及一个多方面的推理过程,远不止于简单的视觉吸引力,而这往往被当前的计算模型所忽略。本次演讲将首先概述人工智能生成视觉艺术内容的现状,并初步尝试捕捉这一复杂的过程,研究如何有效地激发多模态大模型(MLLM)的推理能力以进行审美判断。我们最近的研究结果揭示了一个关键挑战:MLLM在进行审美推理时容易产生幻觉,表现为主观意见和缺乏依据的艺术解读。我们将证明,通过采用基于证据的客观推理过程,可以克服这些局限性,正如我们提出的基线算法ArtCoT所证明的那样。基于此原则的多模态大模型能够产生多维度、深入的审美推理,与人类的审美判断更为吻合。这些发现可直接应用于人工智能艺术辅导以及生成艺术的奖励模型等领域。我们希望所提出的审美推理框架最终能够为构建一个能够真正理解并欣赏艺术作品,也可以像人类一样进行具有个性化的艺术创作的人工智能系统铺平道路。




朱文武

国家级领军人才,清华大学长聘教授

个人简介:朱文武,清华大学计算机系长聘教授、原信息科学与技术国家研究中心副主任。长期从事多媒体信息处理与智能研究。曾任国家973计划项目首席科学家,国家基金委重大项目负责人,教育部人工智能科技创新专家组成员等。三次获国家自然科学二等奖(排名1/2023年, 排名1/2018年, 排名2/2012年)。IEEE Fellow、ACM Fellow、SPIE Fellow、AAAS Fellow、欧洲科学院(Academia Europaea)院士。先后任IEEE Transactions on Multimedia主编,IEEE Transactions on Multimedia 指导委员会主席,IEEE Transactions on Circuits and Systems for Video Technology主编等。 获2023年ACM SIG多媒体杰出技术成就奖和2024年IEEE电路与系统学会Charles A. Desoer技术成就奖。

报告题目:面向具身智能的生成式模型:进展与趋势

报告摘要:具身智能是指智能体与物理环境通过主动感知、具身认知、动作交互形成的智能系统。世界模型是智能体对物理环境的内部表征与未来预测,可以抽象环境的动力学模型并理解真实世界的运行规律;生成式世界模型通过生成式建模学习环境状态及其动作后果,其为具身智能统一建模多模态信息、环境状态与动作决策提供新路径。本报告围绕面向具身智能的生成式模型,首先介绍具身智能、世界模型及生成式世界模型的基本概念与发展脉络。进而,针对智能体与物理环境交互复杂性这一重大挑战,提出理解—生成一体化的生成式世界模型,旨在构建具有时空一致性、物理一致性、动作可行性与交互自演化的生成式世界模型。最后,介绍自主具身智能研究范式,探讨其学术前沿与未来研究方向。




高新波

国家级领军人才,西安电子科技大学校长

个人简介:高新波,博士,教授,西安电子科技大学党委副书记、校长,国家级领军人才入选者,大数据安全教育部工程研究中心主任。IEEE Fellow,中国电子学会、中国计算机学会、中国人工智能学会、中国图像图形学会会士。主要研究方向:人工智能、机器学习、计算机视觉和模式识别。作为团队负责人分别入选教育部长江学者创新团队、科技部重点领域创新团队。主持国家自然科学青年科学基金(A类)等课题30余项,发表论文500余篇,出版专著、教材7部。2020年获全国创新争先奖状,曾获得国家自然科学二等奖1项、国家级教学成果二等奖1项、省部级科技一等奖6项。

报告题目:以人为中心的可信视觉智能

报告摘要:该报告面向计算机视觉从感知理解走向高自主决策与物理执行的新阶段,系统梳理了以人为中心的可信视觉智能的发展现状与核心概念。在此基础上,针对视觉智能系统在隐私保护、公平性、鲁棒性、透明性与安全性等方面面临的现实风险,强调人作为数据主体、认知参与者与最终控制者的多重角色,提出以“物理-信息-认知”三元空间融合为主线的统一框架。进一步,报告围绕“分析对象关注于人、模型设计服务于人、系统应用受控于人”三个方面介绍了团队近年来取得的初步研究成果,并探讨了以人为中心的可信视觉智能的未来发展趋势。




姜育刚

国家级领军人才,复旦大学副校长

个人简介:姜育刚,复旦大学副校长,兼任智能机器人与先进制造创新学院院长、可信具身智能研究院院长,教育部长江学者特聘教授,IEEE/IAPR/CCF Fellow。长期从事多模态人工智能与具身智能研究,担任国家自然科学基金委创新群体带头人、上海市多模态具身智能重点实验室主任,主持新一代人工智能国家科技重大专项、国家重大科研仪器研制项目等。发表论文300余篇,著有《人工智能:数据与模型安全》等中英文著作三部,多项发明技术在知名企业转化成效显著。构建的开源数据和工具集被广泛采用,研发的应用系统多次服务国家关键领域的重要任务。以第一完成人获2023年度国家自然科学奖二等奖和4项省部级一等奖,获全国创新争先奖、何梁何利基金奖、科学探索奖、首届上海杰出人才等荣誉。

报告题目:多模态人工智能:感知、生成与决策

报告摘要:多模态人工智能通过整合视觉、文本、声音等多种信号,能够准确地捕捉环境信息、理解物体关联,并对未来进行预测,进而支撑具身智能体在物理世界的高精度作业,被认为是通往强人工智能的关键技术。本报告介绍团队在感知、生成、决策等多模态人工智能核心方向上的最新进展,并展望未来发展趋势。




季向阳

国家级领军人才,清华大学教授

个人简介:季向阳,清华大学自动化系教授、脑与认知科学研究所所长,主要研究方向为人工智能、机器视觉等。获国家杰出青年科学基金,国家万人计划领军人才,中国青年科技奖等学术荣誉;任中国图像图形学会常务理事、人工智能学会深度学习专委会主任、全国信息技术标准化技术委员会计算机视觉组组长等职务。近年来发表Nature子刊、IEEE Trans. TPAMI、IJCV、NIPS、ICML、CVPR、ICCV等SCI/EI论文100余篇;授权国家发明专利40余项,国际发明专利10项,获得第 70 届纽伦堡国际发明金奖 2 项、2022年日内瓦国际发明展金奖;课题组曾在机器视觉领域国际比赛中获得40余项比赛冠军。获2023年国家技术发明二等奖、2019年国家科技进步二等奖等科技奖励。

报告题目:机器视觉空间计算技术及应用

报告摘要:人工智能前沿正聚焦生成式AI、多模态与大模型技术突破。其核心在于赋能千行百业,驱动智能变革,正引发社会生产与知识创造范式的深刻变革。机器视觉产业规模庞大且具有重大的战略与国防意义,是人工智能领域核心发展方向之一,其通过视觉信息获取与处理、场景中目标物体的空间属性计算,实现目标精确感知与理解,辅助、代替和超越人类完成相关任务。报告首先阐述机器视觉空间计算技术的历史沿革与前沿发展,随后介绍如何通过系列视觉位姿估计创新技术推进高精度、鲁棒与强泛化的视觉空间计算,探讨面向场景空间交互的视觉重建与理解技术,并一步探讨视觉空间计算技术在工业、航空航天等领域的应用现状与趋势。




彭宇新

国家级领军人才,北京大学博雅特聘教授

个人简介:彭宇新,北京大学二级教授、博雅特聘教授,IEEE/CCF/CAAI/CIE/CSIG Fellow,2019年国家杰青,2025年国家杰青延续资助,2019年国家万人领军人才,2018年科技部中青年科技创新领军人才,863项目首席专家,国家重点研发计划“社会治理与智慧社会科技支撑(平安中国)”重点专项总体专家组专家,中国工程院“人工智能2.0”规划专家委员会专家,中国人工智能产业创新联盟专家委员会主任,中国图像图形学会副理事长,北京图象图形学学会副理事长。主要研究方向为多媒体分析、计算机视觉、人工智能。以第一完成人获2016年北京市科学技术奖一等奖和2020年中国电子学会科技进步奖一等奖,2008年获北京大学宝钢奖教金优秀奖,2017年获北京大学教学优秀奖。主持了863、国家自然基金重点(2项)、北京自然基金联合基金重点、发改委专项等40多个项目。发表TPAMI、IJCV、CVPR、NeurIPS、ICML等ACM/IEEE Trans.和CCF A类论文近200篇,获最佳论文奖2次。参加10届(10年)由美国国家标准与技术研究院(NIST)举办的国际评测TRECVID视频搜索比赛,均获第一名,参赛队伍包括斯坦福大学、卡内基梅隆大学、牛津大学等。成果应用于国家网信办、公安部、国家广播电视总局等重要单位以及华为、腾讯、快手、蔚来、美团、中国电信、中国铁塔等头部企业。担任IEEE TCSVT高级领域编委、IEEE TMM等期刊编委,培养博士生获中国计算机学会、中国电子学会等优博。

报告题目:细粒度家族:迈向更细、更深、更快的视觉感知

报告摘要:多模态大模型在通用任务上表现出色,但缺乏细粒度感知能力,如何提高视觉感知的精度、深度与速度,是多模态大模型急需解决的关键问题。本报告将首先阐释“细粒度家族”的定义,涵盖类别、空间、时间三个感知维度,并分析现有大模型在每个维度上面临的挑战。针对上述挑战,本报告介绍团队在基于细粒度树的分层图像分类、多模态大模型细粒度视觉感知、细粒度图像token剪枝、细粒度美学照片重构、细粒度动作质量评价等方面的最新研究进展。最后,介绍团队在细粒度视觉内容理解与生成技术上的落地应用。




熊辉

国家级领军人才,香港科技大学(广州)协理副校长

个人简介:熊辉,香港科技大学(广州)协理副校长、讲座教授,获国际人工智能促进协会会士(AAAI Fellow)、美国科学促进会会士(AAAS Fellow)、电气电子工程师学会会士(IEEE Fellow)、国际计算机学会会士(ACM Fellow)、中国人工智能学会会士、中国计算机学会会士、国际计算机学会(ACM)杰出科学家、国家重大人才工程入选、教育部长江讲座教授、海外杰青、广东省劳动模范、广州优秀科技工作者等荣誉。他担任广州市九三学社副主任委员、广州市人民政府参事、广州欧美同学会副会长、中国计算机学会大数据专家委员会副主任、Nature npj AI创刊主编等多个重要政府、社会和学术职务。此前任美国罗格斯大学终身杰出教授、百度研究院副院长及首席科学家(T11)。主要从事人工智能与数据挖掘研究,主持科技部国家重点研发计划及国家自然科学基金重大研究计划重点支持项目,担任广东省全域智能前沿基础科学重点实验室主任。熊辉教授的Google Scholar引用已超70000次,h-index 106,曾获国际人工智能顶会AAAI最佳论文奖、瑞士日内瓦国际发明金奖2项、ACM SIGKDD服务奖等顶级奖项,并多次担任KDD、ICDM等行业大会主席。在人才培养方面,已有数十位学生成为国际知名大学教授。

报告题目:体用一如:类脑为体,具身为用

报告摘要:当前具身智能正从技术验证迈向产业落地,但受制于数据稀缺、感知盲区、能耗过高和泛化不足四大瓶颈。本报告提出一套"类人化"技术路线,从数据、感知、认知到行为实现系统性突破:数据层,融合互联网视频与肌电信号,兼顾精度与实时性;感知层,仿生事件相机与主动空间记忆突破视野限制;认知层,开源类脑VLA架构NeuroVLA以极低功耗与超短延迟在真实机器人部署;行为层,生成式强化学习实现多模态毫秒级推理。基于此,我们推出全球首个一站式具身智能开源平台AlphaBrain,集成类脑VLA、强化学习Token训练、世界模型与持续学习,提供全栈工具链,推动具身智能走向可解释、低成本与通用化。本演讲将系统阐述该技术体系的构建逻辑与未来图景。




陈钱

国家级领军人才,中北大学校长

个人简介:陈钱,中北大学党委副书记、校长,教育部"长江学者奖励计划"特聘教授。长期致力于红外与微光彩色夜视、高灵敏度光电探测器件、计算光学相位成像领域理论与技术创新的研究和器件与装备的自主可控。获国家技术发明奖二等奖1项、国家科技进步二等奖1项、部省级科技一等奖5项;授权发明专利135项、PCT/美国专利20项;出版著作3部,发表SCI论文400余篇,封面论文50余篇。入选首批"新世纪百千万人才工程"国家级人选、国防科技工业"511人才工程"学术技术带头人、国防科技工业有突出贡献中青年专家、科睿唯安全球高被引科学家。荣获光华工程科技奖、全国创新争先奖、教育部首届优秀青年教师奖、享受国务院政府特殊津贴。目前,兼任中国光学工程学会会士、中国光学工程学会常务理事、中国电子学会常务理事。

报告题目:计算显微成像

报告摘要:光学显微成像是"向极微观深入、不断突破人类认知边界"不可替代的基本科学手段。然而,传统光学显微成像长期受二维强度投影、有限空间带宽积和光学衍射极限等约束,发展兼具"动态、无标记、三维成像"为特征的新型计算光学显微镜,已成为更深层次探索微观世界、解析生命本质与实现精准医疗所急需的前沿科学仪器。报告围绕显微成像由"二维定性"向"三维定量"、由"衍射受限"向"高速超分辨"跨越的核心瓶颈,在"非干涉定量相位显微成像与计算光学三维层析超分辨"方向取得一系列突破,研制出首台非干涉多模态定量相位显微镜SCscope与非干涉活细胞三维层析超分辨显微镜等新型计算光学显微镜系列产品,有力推动了我国显微科学仪器从跟跑到并跑、再到创新引领的跨越。