没有一种模型能包打天下
适合某项任务的模型取决于任务本身。用庞大的推理模型做一行文本分类,既费钱又增加延迟;而小而快的模型面对复杂的结构化抽取又会力不从心。选得好,靠的不只是读基准榜,而是你自己的评测。
构建黄金测试集
黄金测试集是几十条真实输入及其已知正确答案,取自你的应用实际会遇到的流量。要包含棘手的用例:含糊的措辞、边界输入,以及其他模型曾失败的例子。二十五条精心挑选的用例,胜过两百条泛泛而谈的样本。
为你关心的行为打分
定义在你任务中“好”意味着什么。抽取任务就比对字段是否精确匹配;分类任务就统计你实际使用的标签准确率;聊天任务则用评分表衡量有用性,并单独检查格式合规。在一个维度得分高的模型,可能在另一个维度失分。
把不同任务路由到不同档位
先用便宜模型跑黄金测试集。通过就直接上线;失败就只把失败的用例升级到更强的模型。这种路由模式,正是生产系统在真正重要的地方不牺牲质量、又能控制成本的方式。
每季度重新评估
模型阵容变化很快。上一季度还属中档的模型,如今可能在你的测试集上胜过旗舰选项。每季度重跑同一套评测,让数据而非营销决定每个任务该路由到哪个档位。
评论(167)