TinyLM Labv2 · MoE / RoPE / SwiGLU

計 — params
有効 params
01 · CORPUS

学習テキスト

文字数 0 語彙(異なり文字) 0

文字レベルで学習します。連続する空行が多いテキストは、生成時にも改行が多く再現されます。気になる場合は正規化を有効にしてください。複数ファイルを選ぶと連結されます。20万字を超えると欄内はプレビュー表示になりますが、全文が学習に使われます。目安: ナノ〜マイクロは数万〜数十万字、スモール以上は数百万字以上を推奨。

02 · SCALE

規模プリセット

総パラメタ 有効パラメタ/トークン 推定学習メモリ

エキスパート数1でMoE無効(通常の密なFFN)。MoEでは各トークンがtop-k個の専門家だけを使うため、総パラメタが増えても1トークンあたりの計算規模(有効パラメタ)は抑えられます。ただしこの実装は教育用に全専門家を密に計算してマスクするため、速度面の節約はありません。

03 · TRAIN

学習

step 0 loss aux tok/s backend

高速モードではtop-kマスクもGPU上で構築します。数学は通常モードと同一で、loss曲線と稼働率の表示が粗くなるのと、ルーター確率が完全に同値になった場合の同点処理だけが異なります。MoE使用時のスモール以上の規模で効果が大きくなります。

tf.js を読み込み中…
04 · SAMPLE

文章生成

top-pは確率上位の候補だけからサンプルする設定です(1.00で無効)。改行や記号など低確率トークンの暴発を抑えます。

まだモデルがありません。初期化して学習するか、保存済みモデルを読み込んでください。
05 · I/O

モデルの保存と読み込み

重み・語彙表・構成をまとめた JSON を端末に保存します(形式: tinylm-lab-v2)。読み込めば続きから学習できます。すべての処理はこの端末内で完結し、通信は行いません。目安として2,000万パラメタを超えるとファイルが数百MBになり、ブラウザによっては保存に失敗します。