
这周逛 GitHub 看到一个项目,我觉得值得跟你们聊聊。
flyteorg/flyte

Stars:7,149 | Forks:853 | License:Apache-2.0 | 主要语言:Go

说实话,AI 项目从 demo 到生产这段路,我踩过坑。
模型训练跑到一半挂了,不知道从哪续。
批量推理扇出一堆子任务,哪个失败、为什么失败,查起来头大。
agent 调工具、存状态、失败了还要能接着跑——这些事如果全靠脚本堆,后面维护就是噩梦。
Flyte 做的事情很简单:把上面这些"脏活"统一收进一套系统里。
任务怎么跑、失败了怎么办、资源怎么调度、结果怎么复现,它都管了。
Flyte 是一个开源的 AI 工作流编排项目,LF AI & Data Foundation 的毕业项目。
现在主分支推的是 Flyte 2,定位很明确:用纯 Python 编排 ML pipeline、模型服务和 agent,然后把这些任务放到一个可恢复、可观察、可扩展的运行环境里。
有一点要注意:flyteorg/flyte 这个仓库本身主要是 Go 写的(后端 + 协议定义)。但开发者日常写任务的入口是 Python SDK——你写 @task 装饰器包一下函数,本地跑通,再交给 Flyte 执行就行。
它不是聊天机器人框架,也不是 prompt 工具。它管的是 AI 应用背后的基础设施。

① Python 是一等公民
很多工作流平台逼你学 YAML 或者专用 DSL。
Flyte 不一样。它的 hello world 就是普通 Python 函数:
@task
def my_task(x: int) -> int:
return x + 1
定义好 TaskEnvironment,装饰器一包,本地就能跑。要用 CLI 提交到远程也只是一行命令:
python hello.py
flyte run hello.py main --numbers '[1,2,3]'
最小入口很轻:
uv pip install flyte
② 连模型服务也一起管了
大部分 MLOps 平台只盯着离线训练和数据处理。
Flyte 多做了一步:它把模型服务也纳入进来。
README 里有个 FastAPI 示例——用 FastAPIAppEnvironment 包住你的服务,flyte serve 一启就跑起来了。model endpoint 这类长期服务,也在它的管理范围内。
flyte serve serving.py env
③ 已经开始拥抱 agent
这一点我觉得挺重要的。
官网首屏给的示例就是 durable agents。文档导航里有 Build an agent、Agent framework integrations、Build an MCP、Sandboxing 这些入口。
说明 Flyte 2 不只是在沿用老的 MLOps 话术,它在往 agent 工作负载靠。这个方向是对的。

Flyte 2 是大版本升级
官方主分支已经在推 Flyte 2,架构和定位都有变化。建议先读 README 确认和 Flyte 1 的区别,再决定用哪个版本。
开源后端还在推进
README 提到 Flyte 2 Devbox 可用了,但也明确说了完整分布式生产后端还在开发中。如果你要上生产环境,仔细看看当前文档和部署说明,别只看 Python 示例就判断接入成本。
仓库是 Go,日常写任务是 Python
别去仓库里找 Python 任务逻辑,那里面主要是后端和协议定义。你的代码写在自己的项目里,通过 SDK 和 Flyte 交互。
这些情况可以考虑用它:
个人开发者也能用,但要调整预期。
Flyte 的价值不在花哨功能,而在把运行、恢复、扩展这些脏活系统化处理。如果你只是跑一两个实验脚本,可能有点杀鸡用牛刀。
我建议这条线:
先看 README → 再读 Quickstart、Run modes、Run and deploy tasks → 如果关心 agent,重点看 Build an agent、Agent framework integrations 和 Sandboxing。
在我看来,Flyte 适合拿来研究 "AI 工作流怎么长期跑稳"。GitHub上7.1k stars,853 forks,7 月 25 日还有更新记录,维护信号还在。


你们现在用的是什么工作流编排工具?或者还在用脚本硬撑?评论区聊聊 👇