← 文章 / AI技术
Simon Willison 6小时前 · 2026-08-05 06:14:36 · 0 阅读

PipeNetwork/minimax-h3-mlx:在Apple Silicon上运行MiniMax全模态生成系统

PipeNetwork/minimax-h3-mlx。MiniMax 两天前发布了 MiniMax-H3——他们将其描述为“一个通用全模态生成系统”,实际使用中,它能接收文本、图像、音频和视频,并利用这些内容生成最长 15 秒、包含音频的视频片段。

这个 Python 包将其移植到 MLX,以便在 Apple Silicon 上运行。

我在我的 M5 Max MacBook Pro 上成功运行了它。克隆仓库后,按以下方式运行模型:

# 首先下载模型
uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3 \
  --include 'FL2VA/*' --exclude 'FL2VA/transformer/*'
uvx --from huggingface_hub hf download pipenetwork/MiniMax-H3-MLX-8bit

# 然后运行提示
uv run --with mlx-vlm \
  --with-requirements requirements.txt python scripts/generate.py \
  "一只彩虹色的臭鼬跳过超市里长满苔藓的原木" \
  -o skunk.mp4 \
  -c ~/.cache/huggingface/hub/models--MiniMaxAI--MiniMax-H3/snapshots/fa9c8ab1eaa21c8ae25e7e40b83b2e6002f340af/FL2VA \
  -t ~/.cache/huggingface/hub/models--pipenetwork--MiniMax-H3-MLX-8bit/snapshots/3ac52081470b0488921c3ec3ba84a39097bf2361

以下是我根据提示生成的视频:

一只彩虹色的臭鼬跳过超市里长满苔藓的原木

Your browser does not support HTML5 video.

它下载了约 115 GB 的模型文件,视频生成耗时不到 45 分钟。

视频效果令人印象深刻,但音频却像奇怪的语音噪声,因为我没有提供任何关于音频应如何的提示指导。提示编写指南(我在这次实验前没读过)提供了大量关于如何实现这一点的信息。

原始来源: Simon Willison

评论 (0)