我刚才在 HF 上闲逛找小体积 LLM,结果撞见了这个 Spark-X2.5 系列。看下来它不像是微调出来的,模型有自己的架构。
现在出了 4B 和 1.7B 两个版本,跑分还挺有意思——4B 版本跟 Qwen 3.5 9B 基本咬得死死的。HF 页面上说这两个模型都原生支持 1M 上下文长度。
不过目前 llama.cpp 还没法直接跑,得等一个 PR 合进去才行。作者自己弄了个自定义 fork 是能用的。
有没有人已经试过这模型了?效果到底咋样?
补充一下:GGUF 版本已经有了,但现在还是得用那个自定义 fork 才能跑。