旅3日目。今日は徳島市内から西、美馬市脇町まで移動。
吉野川はしばらく景観に変化がないため田んぼや山の近くまで寄り道。しばらく走ると田畑の中にぽつぽつと小規模な墓地が見えて特異だなあと気付く。結構特殊な景観のような気がするので、GISデータを日本全国で集計して分析したさがある。
自転車に乗っている時は骨伝導イヤホンの Shokz OpenRun Pro 2 を装着して YouTube のオフライン保存した動画を聞いてる(注釈:安全運転のため周囲の音が聞こえる状態で利用)。今日は AI Engineer チャンネルの内容が多め。Jev 公開前の 7/1 の話が面白かった。
Diogo Almeida のトーク「What’s next after RLHF?」。TypeSafe AI の CEO で OpenAI にいたときは GPT-4 の co-author のひとりでもある。post-training の概念を発明したひとりでもある。メインの内容はシンプルで、RLHF の human preference に依存して生まれる assistance のためにデザインされたものではなく、automation こそ実現したいものだという話。
面白かったのは質疑応答。Sutton の有名な bitter lesson の full stack LLM 版として bitterest lesson を紹介。algorithm, compute よりもデータが重要であり、データよりも適切なタスクを実行することが重要と説いている。適切なタスクを実行というのが post-training の話っぽい。RLHF は human preference に最適化するし、RLVR は正解率のような log error rates に最適化する。これに対して TypeSafe AI は calibrated decision-making に対して最適化して、pre-trained models を有用にする。pre-training models について結構すでに素晴らしいものという視点を持っていたところも印象的。human preference を徹底的に排除してそうな気配を感じた。
明日は高知を目指す。ヒルクライムで力尽きないか心配。
