You need to agree to share your contact information to access this model
This repository is publicly accessible, but you have to accept the conditions to access its files and content.
本モデルは moe-speech データセット(著作権法30条の4の情報解析目的限定・再配布禁止)由来の派生モデルです。 利用目的を申告のうえアクセスを申請してください。
Log in or Sign Up to review the conditions and access this model content.
StableTTSEx 日本語 — Phase 2/3 研究チェックポイント(未採用・否定的結果)
これは StableTTSEx(KdaiP/StableTTS v1.1 フォーク・日本語特化)の ゼロショット話者類似性の改善を狙った Phase 2・3 研究で学習した 未採用 チェックポイント群です。
いずれも baseline(stable-tts-v1.1-japanese-378h)を 上回れず不採用となった否定的結果ですが、再評価・スクラッチ再学習の足場として保存しています。 通常の推論には baseline または tsukuyomi-ft を使ってください。
結果サマリ(dopri25 公平比較 / ECAPA spk_cos / n=15)
| ディレクトリ | 施策 | 初期値 | spk_cos(baseline 0.6502 比) | CER | 結論 |
|---|---|---|---|---|---|
vast_run2_phase2 |
logit-normal timestep + EMA | upstream→15ep | 0.6278 / 0.6304(EMA)(−0.020) | 維持 | 不採用 |
vast_run3_tla_sa |
TLA-SA 補助話者整列損失(WavLM 教師) | upstream→15ep | 0.6408(−0.009) | 微悪化 | 不採用 |
vast_run4_mrte |
MRTE 参照 mel 系列への cross-attention | japanese-378h→15ep | 0.6432(−0.007) | 同等 | 不採用 |
共通の失敗要因: 既に pooled style vector で学習済みの重みへ機構を後付け継続学習しても、pooled ボトルネックは緩和できない (既存の到達点が局所最適で新機構を使わない方向へ収束。MRTE の cross_gate は 0.0006〜0.0009 までしか開かなかった)。 詳細は docs/research-summary.md / docs/phase3-plan.md §11–13。
ファイル
vast_run2_phase2/checkpoint_14.pt… 生重み(logit_normal 学習)。use_mrte=False、api.pyでそのまま推論可。vast_run2_phase2/ema_checkpoint_14.pt… EMA 推論用重み。同上。vast_run3_tla_sa/checkpoint_14.pt… 推論用重み。TLA-SA ヘッドは推論時に破棄されるため state_dict は baseline と同一キー・use_mrte=False、api.pyでそのまま推論可。vast_run3_tla_sa/tla_sa_head_14.pt… 補助ヘッド(再学習・再評価用。推論には不要)。vast_run4_mrte/checkpoint_14.pt… use_mrte=True アーキテクチャ(33,225,345 params)。推論にはModelConfig(use_mrte=True)の指定が必要。
推論での読み込み
vast_run2 / vast_run3(use_mrte=False = baseline と同一アーキ):
from api import StableTTSAPI
tts = StableTTSAPI("vast_run3_tla_sa/checkpoint_14.pt", "vocoders/pretrained/bigvgan_generator.pt", "bigvgan")
vast_run4(MRTE = use_mrte=True):
from api import StableTTSAPI
from config import ModelConfig
tts = StableTTSAPI(
"vast_run4_mrte/checkpoint_14.pt",
"vocoders/pretrained/bigvgan_generator.pt",
"bigvgan",
tts_model_config=ModelConfig(use_mrte=True), # per-checkpoint アーキ指定(commit 6052046 以降が必要)
)
ライセンス
moe-speech データセット由来のため、情報解析目的限定・再配布禁止の派生モデルとして gated 公開しています。 利用目的を申告のうえアクセスを申請してください。