把昂贵的 LLM 调用蒸馏到窄任务上

一句话价值:任务范围固定且窄时,没必要每次都调最贵的模型
亮点:用蒸馏把一次贵调用替换成便宜的小模型

为什么值得关注

成本是 AI 落地最硬的约束之一。这个项目的思路很朴素:如果你的任务范围窄且固定,就没必要反复调用最贵的模型。对批量场景这可能是数量级的差异。实际效果与适用范围待核实。

和我们的判断的关系

直接呼应「09-Token 与计费」:省钱的杠杆在减少不必要的贵调用,而不只是谈单价。先统计你的调用里有多少是重复且窄的,那一部分最值得优化。