Repository navigation
docs: 全掃引を3曲目で測り直す — 判断は動かず、理由が変わった - #26
Merged
Merged
Conversation
Known limits 冒頭の「3 曲目では測り直していない、"both tracks" は文字通り その 2 曲」という但し書きを、実測結果に差し替える。 8 案のうち 7 案が 3 曲目で**ビット単位に不活性**(掃引した全値で shipped と 同一の配置)。λ=1.2 は 1 曲目を 19/20→1/20 に崩壊させる強さだが、3 曲目は 1 行も動かない。3 曲目に直すべき誤配置が無いから(worst 0.81s / 外れ値 0)で、 7 案は全部 repair 機構だから発火しようがない。 これで不採用の理由が変わる。2 曲では「ここで得た分をあちらで払う trade」に 見え、どちらを重く見るかが読み手の裁量に落ちていた。trade ではない。 upside は既に壊れている曲にしか無く、downside(greedy の idx が全ての決定を 隣に運ぶ)は全曲に掛かる。 8 案目の語頭スナップだけが不活性でなく、3 曲目でも悪化(0.35→0.48s / ≤0.5s 29/38→20/38)=3 曲中 3 曲で悪化。 ## 他の変更 - 4 案の表に虎徹列を追加(全行 *identical*)。断言でなく表で見えるようにする - 可変 pairing の details に、3 曲目 large-v3 の「採用に見えるが母集団の すり替え」を追加。mean 1.35→0.28 だが外れ値を除いた本体は 0.290→0.284 = GT 分解能の 30 分の 1。上では無採点の半分がコストを隠し、ここでは 採点母集団が縮んで利得を作った - auto pairing の表に虎徹 2 行を追加。large-v3 は各曲の auto で 3 曲中 2 曲が 悪化(虎徹は large-v3 の方がセグメントが少ない: 32 < 36) - 3 曲目の位置づけを「裁定する」から「棄権した、そちらの方が有用だった」に訂正
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
Known limits の冒頭にあった但し書き:
測り直したので差し替える。再現ハーネス側の対応は toryu-web #473(
exp_*.pyが 2 曲固定だったのをtracks.pyに括り出して 3 曲体制にした)。結果 — 8 案中 7 案が 3 曲目で完全に不活性
掃引した全ての値で shipped とビット単位に同じ配置になる。λ = 1.2(1 曲目を 19/20 → 1/20 に崩壊させる強さ)でも 3 曲目は 1 行も動かない。
理由は 3 曲目に直すべき誤配置が無いこと(worst 0.81 s / 外れ値 0)で、7 案は全部 repair 機構なので発火する対象が存在しない。
これで不採用の理由が変わる。 2 曲では「ここで得た分をあちらで払う trade」に見え、どちらを重く見るかが読み手の裁量に落ちていた。trade ではなかった — upside は既に壊れている曲にしか無く、downside(greedy の
idxが全ての決定を隣に運ぶ)は全曲に掛かる。8 案目の語頭スナップだけが不活性でなく、3 曲目でも悪化(0.35 → 0.48 s / ≤0.5 s 29/38 → 20/38)= 3 曲中 3 曲で悪化。
変更点
Known limits 冒頭 — 但し書きを実測結果に差し替え
4 案の表に虎徹列(全行 identical)。断言でなく表で見えるようにした
可変 pairing の details に、3 曲目 large-v3 で唯一「採用に見えた」構成とその正体を追加:
large-v3mean は 4.8 倍良いが本体は 0.006 s しか動いていない(その曲の GT 分解能の 30 分の 1)。29 s ずれた 1 行が honest miss に落ち、別の 1 行が miss から +0.12 s で戻っただけ。誤答を「わからない」に替えるのはこのツールが望む挙動だが精度改善ではなく、しかも medium では固定と完全に同一。上では無採点の半分がコストを隠し、ここでは採点母集団が縮んで利得を作った。
auto pairing の表に虎徹 2 行。large-v3 は各曲の auto pairing で 3 曲中 2 曲が悪化(虎徹は large-v3 の方がセグメントが少ない: 32 < 36)。model upgrade は曲ごとに測るもので、既定で手を伸ばすものではない、と明記
3 曲目の位置づけを訂正。「裁定するために足した」→「足した。裁定はせず棄権した。そちらの方が有用な答えだった」
数字はすべて
scratchpad/lyrics_align_benchの JSON が正本。