IT之家 7 月 31 日消息,稀宇科技今天宣布推出 MiniMax H3 通用多模态视频模型,魔搭社区显示,这款模型将于北京时间 8 月 3 日 0 点正式开源。

MiniMax H3 支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持 15s 2K 分辨率。
IT之家获悉,得益于 Contextual Omni Representation,H3-VAE,H3-Omni Transformer,In-context Regeneration 等多项技术,MiniMax 称有能力提供行业内最优的性价比,默认提供 2K 的分辨率,模型在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 分辨率下是主流模型 720P 的 1/2。
官方表示,这款模型有以下亮点:
原生多模态理解与生成:支持文字、图片、音频、视频等多种输入,理解不同素材中的人物、动作、声音、情绪、镜头、风格与表达意图,并将多种参考信息自然融合。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8vBdVEaynZU

小同爱分享2 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享5 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享