在生成式AI技术向垂直场景深度渗透、多模态融合能力成为产业智能化核心竞争力的行业背景下,来自浙江省的当虹科技推出了国产生成式AI产品——BlackEye多模态视听大模型,该产品已于2024年12月18日完成备案,备案编号为ZheJiang-BlackEye-202410250014,是国内少数聚焦音视频原生理解与生成的专业级大模型产品,面向全行业的视听场景智能化需求打造,填补了通用大模型在专业视听处理领域能力不足的市场空白。
BlackEye多模态视听大模型的核心功能围绕视听全链路处理覆盖四大方向:第一是跨模态深度理解,支持对高清视频、多声道音频、文本字幕进行统一语义解析,可同步提取视频中的画面主体、行为逻辑、语音内容、环境声特征,输出结构化的语义结果;第二是专业视听内容生成,支持根据文本、语音描述生成符合行业规范的短视频内容,也可对已有音视频进行分辨率提升、帧率补全、音效增强、字幕自动生成与翻译,满足专业内容生产的提质需求;第三是视听内容智能分析与审核,可自动识别视频中的违规内容、安全风险、品牌露出,同时支持对长视频进行内容摘要提取、精彩片段拆分,大幅降低人工运营成本;第四是定制化开发适配,支持面向垂直行业进行轻量化微调,可对接各行业已有的业务系统,实现大模型能力的快速嵌入。
技术特点方面,BlackEye多模态视听大模型依托当虹科技在音视频领域近十年的技术积累,打造了原生视听融合的底座架构,区别于通用大模型拆分处理图文、音频的技术路径,该模型采用统一的视听特征编码框架,对1080P、4K甚至8K高清视频的处理精度比通用大模型提升40%以上,同时针对边缘端部署做了深度轻量化优化,可在本地服务器、边缘计算节点实现低延迟推理,满足对数据隐私有高要求场景的部署需求;此外,模型内置了百万小时级专业视听训练数据,涵盖广电、安防、文旅、互联网内容等多个领域的专业素材,对专业场景的适配性远高于通用多模态大模型。
当前BlackEye多模态视听大模型已经落地多个核心应用场景:在广电新媒体领域,帮助内容制作机构实现内容快速二次创作,自动完成多平台适配的短剪辑、字幕翻译、画质增强,将内容生产周期缩短70%以上;在公共安全与安防领域,支持对海量监控视频进行智能分析,自动识别异常行为、安全隐患,帮助安保人员快速定位风险;在新媒体内容运营领域,帮助MCN机构、内容平台完成内容合规审核,自动识别违规内容,大幅提升审核效率;在智慧文旅领域,支持对景区监控直播内容进行智能语义解析,自动生成景区介绍短视频、识别游客流量异常,助力文旅景区智能化运营。
作为浙江本土培育的国产专业级多模态大模型,BlackEye多模态视听大模型既抓住了生成式AI产业落地的核心方向,也发挥了当虹科技在音视频领域的技术优势,为全行业的视听智能化转型提供了可靠的国产AI解决方案。
在生成式AI技术向垂直场景深度渗透、多模态融合能力成为产业智能化核心竞争力的行业背景下,来自浙江省的当虹科技推出了国产生成式AI产品——BlackEye多模态视听大模型,该产品已于2024年12月18日完成备案,备案编号为ZheJiang-BlackEye-202410250014,是国内少数聚焦音视频原生理解与生成的专业级大模型产品,面向全行业的视听场景智能化需求打造,填补了通用大模型在专业视听处理领域能力不足的市场空白。
BlackEye多模态视听大模型的核心功能围绕视听全链路处理覆盖四大方向:第一是跨模态深度理解,支持对高清视频、多声道音频、文本字幕进行统一语义解析,可同步提取视频中的画面主体、行为逻辑、语音内容、环境声特征,输出结构化的语义结果;第二是专业视听内容生成,支持根据文本、语音描述生成符合行业规范的短视频内容,也可对已有音视频进行分辨率提升、帧率补全、音效增强、字幕自动生成与翻译,满足专业内容生产的提质需求;第三是视听内容智能分析与审核,可自动识别视频中的违规内容、安全风险、品牌露出,同时支持对长视频进行内容摘要提取、精彩片段拆分,大幅降低人工运营成本;第四是定制化开发适配,支持面向垂直行业进行轻量化微调,可对接各行业已有的业务系统,实现大模型能力的快速嵌入。
技术特点方面,BlackEye多模态视听大模型依托当虹科技在音视频领域近十年的技术积累,打造了原生视听融合的底座架构,区别于通用大模型拆分处理图文、音频的技术路径,该模型采用统一的视听特征编码框架,对1080P、4K甚至8K高清视频的处理精度比通用大模型提升40%以上,同时针对边缘端部署做了深度轻量化优化,可在本地服务器、边缘计算节点实现低延迟推理,满足对数据隐私有高要求场景的部署需求;此外,模型内置了百万小时级专业视听训练数据,涵盖广电、安防、文旅、互联网内容等多个领域的专业素材,对专业场景的适配性远高于通用多模态大模型。
当前BlackEye多模态视听大模型已经落地多个核心应用场景:在广电新媒体领域,帮助内容制作机构实现内容快速二次创作,自动完成多平台适配的短剪辑、字幕翻译、画质增强,将内容生产周期缩短70%以上;在公共安全与安防领域,支持对海量监控视频进行智能分析,自动识别异常行为、安全隐患,帮助安保人员快速定位风险;在新媒体内容运营领域,帮助MCN机构、内容平台完成内容合规审核,自动识别违规内容,大幅提升审核效率;在智慧文旅领域,支持对景区监控直播内容进行智能语义解析,自动生成景区介绍短视频、识别游客流量异常,助力文旅景区智能化运营。
作为浙江本土培育的国产专业级多模态大模型,BlackEye多模态视听大模型既抓住了生成式AI产业落地的核心方向,也发挥了当虹科技在音视频领域的技术优势,为全行业的视听智能化转型提供了可靠的国产AI解决方案。