オンデバイスモデルは実用のしきい値を越えた。意図の分類、構造化フィールドの抽出、短文の書き換え、単純なツールの連携を、ネットワーク往復なしで実行できる。これは遅延だけでなく、アーキテクチャそのものを変える。

まずローカル、必要なときだけクラウド

堅牢なAI製品では、プライベートで頻度が高く、遅延に敏感な処理を小型ローカルモデルへ振り分けられる。複雑な統合や最新知識が必要な仕事は、引き続きクラウドが適している。その境界は明確で、測定可能で、利用者に見えるべきだ。

最良のエッジ処理とは、ネットワークが消えたときに価値が高まる処理である。

チームが測るべきもの

タスク成功率、消費電力、最初のトークンまでの遅延、フォールバック率を同時に追跡する。黙って失敗する極小モデルは安くない。予測可能なルーティングを備えた少し大きなモデルの方が、優れたシステムになることが多い。