archive
2026年08月のAIニュース
42件。見出しから個別記事と一次情報の出典へ移動できます。
4件
- GeminiGoogle Classroom、Geminiで課題ごとの評価表を直接作成——先生が確認・編集して追加Google Workspace Updates(公式)
- SeGaBench(AI研究)arXiv論文:AIがコンパイラの見逃した高速化を発見——最良モデルは93.3%の課題で性能向上に成功arXiv(未査読プレプリント)
- ContinualSkillBench(AI研究)arXiv論文:AIエージェントの「スキル蓄積」は常に効くとは限らない——5分野500課題で検証arXiv(未査読プレプリント)
- 推論AIの評価方法(AI研究)arXiv論文:AIの「考える量」を同じ予算だけで比べるのは危険——推論法を3種類に整理arXiv(未査読プレプリント)
18件
- AIエージェント障害検知(AI研究)arXiv論文:AIエージェントの失敗を約200マイクロ秒で検知・再実行——成功率52%から73%へarXiv(未査読プレプリント)
- ParEvalLayer(AI研究)AIMLSystems 2026論文:AI評価は課題の15〜25%で結論できる場合も——途中点だけの公表に警鐘arXiv/AIMLSystems 2026採択論文
- 深掘り調査ベンチマーク(AI研究)arXiv論文:深掘り調査AIを500課題・31分野で検証——根拠確認まで追える評価データを公開arXiv(未査読プレプリント)
- EduZone(AI研究)arXiv論文:学校向けAIの安全性を10モデルで検証——教育特有の危険と長い会話に弱さarXiv(審査中プレプリント)
- Harness-R1(AI研究)arXiv論文:AI本体を変えず「実行の仕組み」を失敗から修正——成功率44.3%から53.6%へarXiv(未査読プレプリント)
- AtumAI(AI研究)arXiv論文:データセンターの運用ルールをAIが設計——配置・増減・電力の3課題で専門家案を上回るarXiv(未査読プレプリント)
- GitHub CopilotGitHub Copilotのクラウドエージェント、課題ごとに「考える量」を選択可能——高設定はAIクレジット増に注意GitHub公式Changelog
- GitHub CopilotGitHub Copilot、自動化をIssue・PRコメントから起動——文書更新、エラー調査、後続課題の作成に対応GitHub公式Changelog
- GeminiGoogle ClassroomのGemini、年齢制限を拡大——8月10日から小中高生も授業資料でクイズ・暗記カードを作成Google Workspace Updates公式ブログ
- Gemini in Google MeetGoogle MeetのAI議事録、共有画面のスクリーンショットを自動追加——グラフや図の説明不足を補完Google Workspace Updates公式ブログ
- AI予測評価(AI研究)arXiv論文:検索できる最先端AIのW杯勝敗予測は平均63.9%——ブックメーカー本命と同水準、AI多数決も効果なしarXiv(未査読プレプリント)
- 音声・文字入力のAI耐性(AI研究)arXiv論文:AIへの音声入力は文字入力より回答精度を下げやすい——考える量を増やしても音声の弱さは残るarXiv(未査読プレプリント)
- Claude Platform on AWSAWSだけで“本家Claude”を契約——Claude Platform on AWS一般提供、ただしデータはAWS境界外AWS公式Machine Learning Blog
- Genspark GenOfficeGenspark、AI版Officeを丸ごと公開——Word・Excel・PowerPoint・PDFを1つに、ソースコードもApache 2.0Genspark公式GitHub
- LFM2.5-2.6B(Liquid AI)スマホで毎秒30トークン、2.5GB未満——Liquid AIの2.6B小型AIが128K文脈とツール操作Liquid AI公式ブログ
- Gemini NotebooksGeminiに“案件ごとの頭脳”——NotebookLMと双方向同期、Pro・Plusにも展開Google公式ブログ
- DALL·E 2 / DALL·E 3DALL·E 2・3 APIは終了済み——旧画像生成コードは移行必須、後継はGPT ImageOpenAI Developer Community公式廃止案内
- Microsoft Copilot in ExcelExcel Copilotが“AIを選べる表計算”へ——GPT-5.6とClaude Opus 5、Autoも用意Microsoft 365 Copilot公式ブログ
7件
- MANTA(AI研究)arXiv論文:複数AIが仕事中に「チーム編成」を組み替えるMANTA——5評価の平均74.0で従来最高を5.8ポイント上回るarXiv(未査読プレプリント)
- Qwen-UI-Agent(AI研究)arXiv:Qwenの画面操作AI、実機で成功率92.2%——1万環境で100手超を学習arXiv(未査読技術報告)
- MIND(AI研究)arXiv論文:AIの「記憶」に混ぜた攻撃指示を軽量検出——MINDは攻撃成功率を約55%減らし、速度を維持arXiv(未査読プレプリント)
- ExtractBench(AI研究)arXiv論文:企業文書を読むAIを4869ページで比較——長い一覧は欠落しやすく、精度と費用に大差arXiv(未査読プレプリント)
- SafeKeep(AI研究)arXiv論文:AIに道具の仕様を渡すだけで拒否が弱まる——SafeKeepは攻撃成功率を25.6%から2.5%へarXiv(未査読プレプリント)
- ANCHOR(AI研究)arXiv論文:長く話す相棒AI、過去の流れを覚える正確さは平均44.4%——4モデルで人格維持も不安定arXiv(未査読プレプリント)
- GitHub CopilotGitHub、Copilot Billing Previewを本日終了——AI利用量・予算管理は標準の請求画面へ移行GitHub公式Changelog
6件
- ORCA-bench(AI研究)arXiv論文:本番障害を調べるAI、現実的な設定で正答25.3%——難しい課題は10.0%arXiv(未査読プレプリント)
- InfoOps Bench(AI研究)arXiv論文:情報工作へのAIの拒否率は8.8〜94.5%——17モデルを実例2100件超で検証arXiv(未査読プレプリント)
- OSReward(AI研究)arXiv論文:パソコン操作AIの採点モデルは失敗を成功と見なしやすい——低コスト判定AIを公開arXiv(作業中・未査読プレプリント)
- ローカルPC操作AI研究arXiv論文:手元で動くPC操作AI、履歴を増やしても成功率は28.56%で頭打ち——長く考えさせても効果薄arXiv(未査読プレプリント)
- Change2Task(AI研究)arXiv論文:実際のコード変更からAI向け課題を自動再現——Change2Taskは検証済み課題を29.2%多く回収arXiv(未査読プレプリント)
- SaliTrap(AI研究)arXiv論文:AIは目立つ数字に引っぱられ常識を無視——12モデル中、最良でも罠を避けたのは54.8%arXiv(未査読プレプリント)
7件
- AISPA(AI研究)arXiv論文:商用AI 88製品のシステム指示を監査——約4割に利用者の利益とぶつかる指示arXiv(未査読プレプリント)
- Computer-Use Agent評価研究arXiv論文:パソコン操作AIの「失敗」判定15.3%が誤り——5ベンチマーク150件を再監査arXiv(未査読プレプリント)
- 画像モデレーション評価研究arXiv論文:画像AIの安全判定、白黒化や色反転でも回避可能——商用3サービスを横断検証arXiv(未査読プレプリント)
- ReToken(AI研究)arXiv論文:長い動画を読むAI、必要な映像だけ選ぶ「1トークン」で精度向上——単一H100で学習・推論arXiv(未査読プレプリント)
- AskChem(AI研究)arXiv論文:化学論文14.7万本を「根拠付き主張」240万件へ分解——AI検索基盤AskChemを公開arXiv(未査読プレプリント)
- Sample More, Reflect Less(AI研究)arXiv論文:AIの「反省・書き直し」、同じ文字数なら単純な複数回答に勝てず——36比較で検証arXiv(未査読プレプリント)
- Astra(OpenAI研究)OpenAI研究発表:AIが数学・理論計算機科学の未解決問題10件を前進——Leanで証明を機械検証、探索費用は約2000ドルOpenAI Research(研究発表・論文)