キーワード解説
ナレッジ・ディスティレーション(知識蒸留)による過学習抑制とモデル圧縮
ナレッジ・ディスティレーション(知識蒸留)は、大規模で高性能な「教師モデル」の持つ知識を、より小型で高速な「生徒モデル」に転移させる機械学習の手法です。具体的には、教師モデルの出力するソフトターゲット(クラス確率分布)を、生徒モデルの学習目標として用います。これにより、生徒モデルは教師モデルの推論パターンや汎化能力を効率的に学習し、過学習を抑制しつつ、同等かそれに近い性能を維持しながらモデルサイズを大幅に圧縮できます。これは「過学習の回避策」の一つとして、特にファインチューニングされたモデルのデプロイメントにおいて非常に有効なテクニックです。
0 関連記事
ナレッジ・ディスティレーション(知識蒸留)による過学習抑制とモデル圧縮とは
ナレッジ・ディスティレーション(知識蒸留)は、大規模で高性能な「教師モデル」の持つ知識を、より小型で高速な「生徒モデル」に転移させる機械学習の手法です。具体的には、教師モデルの出力するソフトターゲット(クラス確率分布)を、生徒モデルの学習目標として用います。これにより、生徒モデルは教師モデルの推論パターンや汎化能力を効率的に学習し、過学習を抑制しつつ、同等かそれに近い性能を維持しながらモデルサイズを大幅に圧縮できます。これは「過学習の回避策」の一つとして、特にファインチューニングされたモデルのデプロイメントにおいて非常に有効なテクニックです。
このキーワードが属するテーマ
このキーワードに紐付く記事はまだありません