
Hot Chips 2026:高帯域フラッシュはメモリの救世主ではない
HBFは安価で大容量のフラッシュをパッケージ上に載せることを約束するが、そのブロック指向のアクセスモデルは、価値に見合わないかもしれないソフトウェアの書き直しを強いる。
要約・翻訳されたテクノロジーニュース。

HBFは安価で大容量のフラッシュをパッケージ上に載せることを約束するが、そのブロック指向のアクセスモデルは、価値に見合わないかもしれないソフトウェアの書き直しを強いる。

Nvidia は RISC-V への CUDA 提供を目指すが、要件は厳しい:RVA23、ACPI、PCIe コヒーレンシなど。既存の RISC-V ボードのほとんどは対象外。
オープンスタンダードのアプローチがデジタル主権にとって重要であり、SignalやMatrixのようなオープンソースの壁に囲まれた庭園がなぜ不十分なのかを考察する。

開発者がSkyrim用のリアルタイムAIゲーミングコンパニオンを開発。複雑なコマンドを受け取り、一緒に戦い、性格を進化させる。すべてローカルファースト処理と最小限のレイテンシで実現。

AlpinDaleのgpt2.cmakeは、Q16.16固定小数点数演算を使用して、GPT-2モデルを完全にCMakeで実装しています。ビルドツールを本来の用途をはるかに超えて押し上げる、ワイルドな概念実証です。
開発者が、Google Workspaceのサインアップページがweb.example.comのような有効なドメインを、ハードコードされた「メールプロバイダ」の正規表現リストのために拒否することを発見 — 修正はフロントエンドのみのバイパス。

エージェントハーネスは、生のAIモデルを実際に制御できるツールに変えるソフトウェアの殻であり、AIラボの囲い込みから脱却する鍵となる。

詳細な実験により、vLLMでアテンションバックエンドを切り替えると、同一の重みとハードウェアでも、実際のエージェントワークロードでモデルのトップ1トークン選択が変わることが示されました。原因はモデルではなく、実装固有の数学です。

ATプロトコル最大のアップデートが、アクセス制御(暗号化ではない)を備えた非公開データのための新しいプリミティブ、Spacesを導入。アルファコード、SDK、ホスト型PDSが実験用に公開されています。

Nari Labsは、Qwen3-TTS 1.7B CustomVoiceのサービングスタックが、単一のH100上で10 RPS、p95の初回音声までの時間が50 ms未満を達成し、チューニング後にvLLM-Omni、SGLang-Omni、VoxServe、M*を凌駕すると主張している。鍵となるのは、Talker、Code Predictor、Codecのための統合スケジューラである。
ある開発者が、60ペンスのRaspberry Pi RP2350チップでPhotoshopを動かし、1990年代のMacをエミュレートした。これは、現代のコンピューティングパワーが驚くほど安価であることを思い出させ、私たちが受け入れている肥大化に疑問を投げかけるきっかけとなる。

Spring AI 2.0.1は、2.0系初の大規模メンテナンスリリースです。7件のセキュリティ修正、暴走するエージェントループを止める新しいツール呼び出し制限、OpenAI音声ストリーミング、そして多数のストリーミング/ツール呼び出しの信頼性パッチが含まれます。