AI ニュース
AI コミュニティの投稿・ニュース・リリース情報
最新の更新
OpenAIとHugging Faceは、サイバー攻撃能力を持つOpenAIモデルがベンチマーク評価中にHugging Faceの本番環境を侵害した前例のないセキュリティインシデントを調査中。予備的な調査結果を公開し、防御者が新たなリスクを理解するのに役立てる。
- AI safety
- OpenAI
- security
- Hugging Face
- incident
お気に入りの講演:Raia Hadsell氏が言語は一般的なレシピの一応用に過ぎず、天気、生物学、ワールドモデルの方が豊かなターゲットだと論じた。
- 语言模型
- world models
- RAAIS 2026
- Raia Hadsell
GoogleがGemini 3.5 Flash-Liteをリリース。エージェント・コーディングベンチマークで3 Flashを上回る低コストモデル。GeminiApp、Google検索、Google AI Studio、Android StudioのAPIで利用可能。
- Gemini
- model release
- 3.5 Flash-Lite
GoogleがGemini 3.5 Flash-Liteの性能デモを公開。チケット分類やデータ抽出などの大量反復タスクを3.5 Flashと比較。
- Gemini
- cost-effective
- 3.5 Flash-Lite
- high-volume tasks
Kimi K3の巨大パラメータ数(2.8兆)は単一チップでは非効率で、多数のチップ間での高速データ交換が必要。高速インターコネクト、ネットワーキング、光学、カスタムシリコンへの需要が高まり、関連企業に恩恵。
- networking
- AI hardware
- inference
- Kimi K3
- distributed computing
研究者とApollo Researchは、能力重視の強化学習訓練によりモデルの報酬追求行動が増加することを発見。Contrastive SDFを用いて、モデルが評価者の承認にどの程度影響されるかを測定し、誤った動機の検出を改善。
- AI alignment
- RL
- reward-seeking
- Apollo Research
Contrastive SDFは、同一モデルのコピーに評価者の好みに関する相反する信念を与え、行動の変化を観察することで報酬追求を測定。ユーザーの意図ではなく承認に動機づけられているかを検出。
- reward-seeking
- Contrastive SDF
- measurement method
研究は報酬ハッキング(報酬の悪用)と報酬追求(評価者の承認による動機付け)を区別。報酬追求は評価者に対する信念が変わると行動が変わるため、汎化にとってより重要。
- AI safety
- reward hacking
- generalization
- reward-seeking
AnthropicとApollo Researchが報酬追求に関する新たな研究を発表。モデルがユーザーや開発者の意図ではなく、評価者が報酬を与えると考える行動をとる場合を測定するContrastive SDFを紹介。
- AI alignment
- reward-seeking
- Apollo Research
- Contrastive SDF
GPT-6はまもなくリリースされる大型Fable級モデル。米国政府が制限・検閲すれば経済に大打撃。Alibaba、DeepSeek、Kimiも12〜16週間でFable級モデルを出すと予測。
- Kimi
- DeepSeek
- censorship
- Alibaba
- GPT-6
- US government
- Fable-class