阿蔺A-Lin@alin_zone
yesterday
Tetris benchmark comparing Jev with a 1.88B local model
Jev 居然输给了一个 1.88B 本地模型?我用俄罗斯方块重新测了一遍 当我看到 this-that-model-1.0 在 68 道决策题上做到 94.1% 准确率,而 Jev 是 76.5% 时,我的第一反应是: 这是真的假的? 一个只有 1.88B 参数、可以在 Mac 本地运行的小模型,真的能在决策任务上超过 Jev 吗? 所以我做了一个俄罗斯方块,让两个模型使用相同的棋盘规则、随机种子和方块顺序。程序负责计算所有合法落点,模型只负责决定方块应该放在哪里。 1️⃣ 一开始,Jev 的表现更好 最初,我先过滤掉明显更差的落点,再把剩下的多个候选位置同时交给模型。 在这一模式下,Jev 的表现更加稳定。 我观察到的一轮里: Jev 消除了 5 行,this-that 消除了 3 行。 如果只看到这里,很容易得出结论:本地小模型还是不如 Jev。 但我后来意识到,这种问题可能并不是 t
94.1% accurate76.5% accurate