LocalLLaMA的各位好,有个事我琢磨挺久了。最早是看到有人吐槽Qwen 3.8 27B的定价比DSV4 Flash贵,主要就是KV cache开销太大。我虽然认同这点,但后来一直在想:能不能靠微调把它弄掉?
结果发现想这块的不止我一个。Arcee那家挺开源友好的公司(之前搞出AFM的)也这么想过,他们拿自己的模型试了,还把DistilKit开源了。他们文章里最让我意外的是这事儿确实能跑通。不过也踩了坑:新层向老师模型学的时候(比如让老师的GQA层教学生新加的KDA层模仿它的表示),在小规模微调(好像就1B tokens)能学得挺像,但GSM8K直接崩了,其他一些数据集倒是差不多。
后来我也自己试了Qwen 3.8 27B,设计了加载层、缓存表示、训学生层这套流程。先在DCLM上跑,序列从512加到2048再到4096,总共也就26万左右unique tokens。效果果然拉胯,跟Arcee说的一样,没见过的部分直接废了。
所以发这长文是想问:咱们社区能不能凑资源一起搞这个微调?我单独试过,一个人真搞不动,这个月光实验就花了一百多刀,基本都用vast ai。要是成了算大家共同的成果,都挂HuggingFace当 collaborator,边跑边修问题。设计阶段和参数、数据集这些我基本搞定了,后面交给agent跑实验和评测,咱们一起找漏洞。就是随便想想,大家有啥资源共享的主意没?