ESP-GMF v1.0 正式发布:一站式构建音视频与 AI 应用
中国,上海
2026年7月28日
乐鑫信息科技 (688018.SH) 正式发布 ESP-GMF (General Multimedia Framework) v1.0,这是 ESP-GMF 首个官方正式版本,也是乐鑫多媒体软件生态发展的重要里程碑。
ESP-GMF 是一套面向乐鑫 SoC 的统一多媒体开发框架,通过统一的数据流模型、组件体系和开发架构,将音频、视频及 AI 多媒体能力整合到同一平台,为开发者提供更加高效、灵活且易扩展的开发体验。
相较于此前主要聚焦音频应用的 ESP-ADF (Audio Development Framework),ESP-GMF 在架构设计、硬件支持范围以及代码复用能力等方面进行了全面升级,可覆盖从音频播放、录音,到 AI 语音、视频通话、蓝牙音频、图像渲染等丰富应用场景。
构建统一的多媒体软件平台
随着音频、视频及 AI 应用不断融合,多媒体开发正朝着更加复杂、多样化的方向发展。过去,不同类型的多媒体应用通常建立在不同的软件框架之上,各自拥有独立的数据模型、接口设计和运行机制,不仅增加了开发成本,也限制了不同功能之间的复用与扩展。
ESP-GMF 通过统一的软件架构,将乐鑫原本分散的多媒体能力进行了整合,构建起统一的数据流 (Data Stream) 模型、模块化组件体系以及可扩展的 Pipeline 架构,为音频、视频及 AI 多媒体应用提供一致的开发方式。开发者无需在多个框架之间切换,即可在同一开发体系中完成不同类型多媒体应用的开发,大幅降低学习成本,提高代码复用率。
与此同时,乐鑫同步构建了 ESP Multimedia Core。作为 ESP-GMF 的底层能力支撑,ESP Multimedia Core 将媒体协议、音视频编解码器、音频算法及图像处理算法等基础能力统一沉淀为底层库,为 ESP-GMF 及未来更多多媒体产品提供长期稳定的软件基础,并将持续伴随乐鑫多媒体生态不断演进。
ESP-GMF v1.0:首个 API 稳定版本
ESP-GMF v1.0 是框架首个 API Stable 官方版本。
本次发布统一了此前多个开发版本,将所有官方组件升级至 1.0.x,意味着后续版本将在保持 API 稳定性的基础上持续演进,更适合产品开发与长期维护。
此次版本主要带来了以下更新:
全部官方组件升级至 1.0.x
所有官方组件均完成正式版本发布,公共 API 已趋于稳定,为产品开发提供长期兼容保障。
新增四大核心模块
ESP-GMF v1.0 新增多个关键能力模块,包括:
-
esp_player:全新的嵌入式多媒体播放器,支持解复用、解码、音视频渲染及 Seek。
-
esp_asrc:音频采样率转换模块,可完成采样率、位深及声道转换,支持软硬件协同加速。
-
esp_video_render:视频与 UI 渲染模块,支持多显示后端、双路视频流、Overlay 及 Widget 系统。
-
gmf_fft:固定点 FFT/IFFT 运算模块,支持 ESP32-S3、ESP32-P4、ESP32-S31 等芯片硬件加速。
多媒体能力进一步完善
结合新增组件,ESP-GMF v1.0 构建起一套完整的音频、视频、多模态 AI 及蓝牙多媒体能力体系,形成覆盖内容采集、处理、播放、渲染与传输的统一功能接口,为开发者提供更加完整、高效的多媒体开发体验。
-
ESP Capture 构建了面向多模态应用的音视频采集入口,集成设备接入、格式转换、音视频编码、图像处理、Overlay、同步及复用等完整能力,并支持自动协商、并行流式传输及本地存储。凭借模块化、低资源开销的架构,可广泛应用于多模态 AI、音视频录制、WebRTC、直播推流及远程监控等场景。
-
ESP Player 提供从解封装、解码到音视频渲染的一站式播放能力,全面支持本地文件、HTTP(S)、HLS 以及外部帧输入,并集成音视频同步、网络缓冲、多轨选择、播放控制、Seek 和倍速播放等功能,以统一接口简化复杂媒体链路开发,帮助开发者快速构建稳定、流畅的多媒体播放应用。
-
ESP Audio Simple Player 提供轻量、易用的纯音频播放方案,在保持低资源占用的同时,支持 MP3、AAC、FLAC、WAV、M4A、Opus 等主流音频格式,以及文件、HTTP 和嵌入式 Flash 等多种音源。组件可根据 URI 自动匹配输入流和解码器,并按需完成采样率、声道及位深转换,让应用通过简洁接口即可获得灵活、高效的音频播放能力。
-
ESP Video Render 提供高性能嵌入式视频合成与显示能力,支持多路视频流、裁剪缩放、旋转、透明度、层级管理,以及视频与 Overlay UI 的一体化合成。结合脏区域刷新、文本与图像组件、LCD/LVGL/帧缓冲后端及双流渲染能力,可高效支撑视频播放器、智能显示、机器人眼睛及摄像头预览等应用。
-
ESP Audio Render 面向多路音频融合与高品质输出,支持多路 PCM 流混音、逐流音效处理及混音后处理,并可灵活接入 ALC、EQ、Sonic 等音频处理组件。无论是背景音乐与 TTS 混播、通知音叠加,还是语音交互与动态音效处理,都可通过统一的音频渲染链路轻松实现。
-
ESP BT Audio 统一整合经典蓝牙与 LE Audio 能力,支持 A2DP、HFP、AVRCP、BAP、TMAP 等丰富协议及角色,并通过统一的事件、音频流和数据接口无缝接入 ESP-GMF 流水线。从音乐播放、语音通话到广播音频,开发者均可快速构建耳机、音箱及智能终端等蓝牙音频产品。结合官方提供的 ESP-BT-Audio 示例,还可快速体验经典蓝牙、LE Audio 以及 Auracast 广播接收等典型应用,加快蓝牙音频产品开发。
面向多款乐鑫 SoC 持续优化
ESP-GMF v1.0 持续针对 ESP32-S31、ESP32-P4 和 ESP32-S3 等乐鑫 SoC 进行优化。其中,ESP32-S31 新增 V4L2 摄像头支持,并支持 MJPEG 转 RGB 解码、多区域视频 Overlay、音视频渲染示例以及 FFT、PPA 硬件加速等能力,为 AI 摄像头、智能显示、人机交互终端等应用提供更加完善的开发支持。
此外,新版本还进一步优化了开发工具链。esp_board_manager 已独立为单独组件,示例工程统一采用 esp-bmgr-assist python 包管理开发板资源,使不同项目之间的配置方式更加一致,进一步提升开发效率。
立即体验 ESP-GMF v1.0
ESP-GMF v1.0 已正式开源,开发者可前往 ESP-GMF GitHub 仓库获取源码,并结合官方文档、完整版本更新说明和乐鑫通用多媒体框架指南,快速体验统一多媒体开发框架带来的音频、视频及 AI 多媒体开发能力。如果您想了解更多技术细节,可以查看 ESP-GMF 技术博客。
欢迎开发者体验并通过 GitHub Issue 或乐鑫开发者社区分享反馈,与我们共同完善 ESP-GMF 多媒体开发生态。

LinkedIn
微信
Twitter
Facebook

