archive
2026年08月のAIニュース
229件。見出しから個別記事と一次情報の出典へ移動できます。
7件
- ClaudeAnthropic、Claudeの安全試験を強化——脱出行動を実行前に止める監視を導入Anthropic
- ChatGPTChatGPT広告、年換算売上10億ドル規模に——セルフサービス販売を欧州・インドなどへ拡大OpenAI
- ChatGPTOpenAI、米カリフォルニア州の若者向けAI安全法案を支持——年齢確認や独立監査を要求OpenAI
2件
- PrivBenchEMNLP 2026論文:文章の匿名化AIを共通基準で測る「PrivBench」、無料の評価基盤を公開arXiv(EMNLP 2026 System Demonstrations採択論文)
- MI-DistillationEMNLP 2026論文:小型AIは長い推論を丸ごと学ばなくてよい——MI-Distillationが学びやすい過程を選別arXiv(Findings of EMNLP 2026採択論文)
21件
- ChatGPTChatGPTで学生の課題品質が約1点向上、批判的思考の訓練はアイデアの幅を広げるOpenAI
- OpenAIOpenAIなど100超の組織、AI時代のサイバー防御を共同要請——病院や水道を優先OpenAI
- Cohere ParseCohere「Parse」正式提供、表や図を含む文書を9言語でMarkdown化——1,000ページ1.50ドルCohere
- WikiSkillAIエージェントの経験をWikiに蓄積する「WikiSkill」、別モデルにもスキルを移せると報告arXiv
- SWE-Primeコード修正AIは成功例を全部学ばなくてよい?「SWE-Prime」、上位10%の履歴で性能向上arXiv
- CritICL小型AIの失敗例を大型AIのヒントにする「CritICL」、少ない生成回数で推論を改善arXiv
- MCR-BenchコードレビューAIは会話が長いほど不具合を見失う?「MCR-Bench」が2,269課題で検証arXiv
- Claude米国の学校向け「Claude for Teachers」、教育委員会単位の無料Enterprise提供を開始Anthropic
- Gemini NotebookGemini Notebook、利用上限を5時間ごとに更新——重い動画・スライド生成は後回し予約も可能にGoogle
- AI研究ClaudeがAIの安全対策を自動研究——10種類の弱点を改善し、最大4.7倍の大型モデルにも有効Anthropic Research(研究報告)
- GeminiGoogle Drive、Geminiが機密度ラベルを自動付与——管理者の指示だけで分類モデルを設定Google Workspace Updates
- TTPO(研究)正解ラベルなしでAIを回答中に学習させる「TTPO」、Qwen3-1.7Bを38.0%から45.2%へarXiv(プレプリント)
- RATIO(研究)科学論文検索を「解決策・広い視点・具体例」で測るRATIO、数百万本から評価データを構築arXiv(プレプリント)
- 音声匿名化研究声のクローンAIを匿名化に転用——再学習なし・7言語で本人特定をほぼ偶然レベルにarXiv(プレプリント)
- RedEvoAgentAIエージェントへの攻撃方法を経験から改善する「RedEvoAgent」、固定攻撃より高い検出力arXiv(プレプリント)
- AI Model Security ScannersAIモデル検査は正答率だけでは不十分——135種類で判定できた範囲が49.6%〜100%と大差arXiv(プレプリント)
- ContextPilotEMNLP 2026論文:長時間働くAIが自分で記憶を整理する「ContextPilot」、短い文脈で性能向上arXiv(EMNLP 2026 Main Track)
- Ladders in ChaosEMNLP 2026論文:翻訳AIは前の案を見て直すと自然になるが、考えすぎると正確さが低下arXiv(Findings of EMNLP 2026)
- Claude Code Plugin Marketplace StudyClaude Codeプラグイン8,351件を分析、指示文と実装スクリプトは一緒に直す必要arXiv(査読中)
- GitHub CopilotGitHub Copilot、Web・モバイル・クラウドエージェントを統合へ——会話データはアカウント存続中保持GitHub Changelog
2件
- Prefix Sliding(研究)長く考えるAIのメモリを一定にする「Prefix Sliding」、学習なしで最大3倍高速化arXiv(プレプリント)
- 複数AIの回答選択研究複数AIは正解を作れても選べない? 判定役と回答数の併用で正答率約64%から約71%へarXiv(プレプリント)
7件
- Recuris(研究)長期タスクのAIエージェント、経験と作業記憶を再帰的に改善する「Recuris」arXiv(プレプリント)
- LAION-BVD(研究)動画・音声AI向け「LAION-BVD」、1,000万時間規模のオープンデータを発表arXiv(プレプリント)
- AI金融調査ワークフロー研究AIは資料を検索できても判断に使わない? 金融調査で「検索・統合の差」を報告arXiv(プレプリント)
- ClaudeClaude in Chromeが正式提供、ブラウザ操作を安全判定付きで自動実行Claude公式ブログ
- IAPO(研究)会話AIの「どの行動が役立ったか」を流れから学ぶIAPO、3評価で従来法を上回るarXiv(プレプリント)
- シミュレーション実験AI(研究)AIエージェントが製薬シミュレーションで比較実験、根拠付きの条件改善を支援arXiv/IEEE ETFA 2026採択論文
- ClaudeClaude Coworkに専用ブラウザ、拡張機能なしでWeb入力や情報収集を代行Claude公式ブログ
12件
- AI研究arXiv論文:リアルタイム動画AIは利用者を正しく案内できるか——OmniAssistBench、最高でも66.4点arXiv(未査読論文)
- AI研究arXiv論文:科学画像を読むAIの弱点を測るVIALS——顕微鏡や分子構造など161課題arXiv(未査読論文)
- AI研究arXiv論文:AIの自己修正は全工程に大型モデル不要——批評役は小さくても効果arXiv(未査読論文)
- AI研究HCOMP 2026論文:AIに頼りやすいほど論理パズルの学習効果が弱まる——利用後の実力を過大評価arXiv(HCOMP 2026採択論文)
- AI研究ICML 2026論文:AIが失敗を短い反省メモにして学習——SRPO、AIME 2024で73.3%arXiv(ICML 2026採択論文)
- AI研究EMNLP 2026論文:検索AIは自分の調査方針に引きずられる——NIS-Agent、トークン費用33%減arXiv(EMNLP 2026論文)
- OpenAIOpenAI、初の独自推論チップ「Jalapeño」の実測結果を公開——電力効率と応答速度で比較機を上回るOpenAI公式ブログ
- ChatGPTOpenAI、ロシア発とみられる影響工作のChatGPTアカウント群を停止——偽装研究機関の宣伝に利用OpenAI公式報告
- AI研究arXiv論文:長時間働くAIの記憶と分業を支えるPrime Agent——ARC-AGI-3を30%から95.5%へarXiv(未査読技術報告)
- AI研究arXiv論文:災害を調べるAIの一貫性を測るEarthVerse——405課題、厳格合格は最高34.81%arXiv(未査読論文)
- AI研究arXiv論文:資料からAI用スキルを自動作成するSkillAlchemy——最強自動方式を8.6ポイント上回るarXiv(未査読論文)
- ClaudeClaude、チャットとCoworkの記憶を共通化——覚えた内容を項目ごとに編集可能Claude公式ブログ
2件
- ClaudeClaude Mythos 5、企業のコード脆弱性スキャンに対応——オープンソース防御へ3,500万ドル分Anthropic公式
- Microsoft CopilotMicrosoft、Dragon Copilotの医療AIアプリ・エージェントを正式提供——診療記録や事前承認を支援Microsoft公式(Healthcare and Life Sciences Blog)
6件
- AI研究arXiv論文:AIは自分を育てる学習法を設計できるか——AI4AI-Bench、最良でも最適点への差の5分の1未満arXiv(未査読プレプリント)
- AI研究arXiv論文:AIの道具操作を追加学習の前から育てるMidTool——API・MCP・文書作業を教材化arXiv(未査読プレプリント)
- AI研究arXiv論文:AIの「自己改善」は測定ミスでも生まれる——未学習モデルにも改善率0.280を誤検出arXiv(未査読プレプリント)
- AI研究arXiv論文:PC操作の記録から仕事の手順を自動発見——TMI、未見課題の正答率を30.0%改善arXiv(未査読プレプリント)
- AI研究arXiv論文:質問ごとに最適なAIを安く選ぶPandora's Router——高価な事前評価を減らして品質維持arXiv(未査読プレプリント)
- AI研究arXiv論文:文書を検索せず答えるAIを3段階で学習——IAR、一般能力を平均12.1ポイント改善arXiv(未査読プレプリント)
4件
- AI研究arXiv論文:最大10人の顔を保って集合画像を生成——WithEveryone、指定人物の97.3%を再現arXiv(未査読プレプリント)
- AI研究arXiv論文:LLMキャッシュは単純なLFUが有力——見かけ51〜60%の再利用も有効回答は1.1〜2.2%arXiv(未査読プレプリント)
- AI研究arXiv論文:AIが問題ごとに考える長さを選択——MATH500で回答量41%減、精度はほぼ維持arXiv(未査読プレプリント)
- AI研究arXiv論文:危険な使い方だけをAIから消せるか——ConceptGuardで現行の知識削除法に弱点arXiv(NeurIPS 2026 E&D Track投稿中・未査読)
5件
- AI研究arXiv論文:AIが自分用の訓練環境も作るSPADE——8評価平均で固定環境を5.3点上回るarXiv(未査読プレプリント)
- AI研究arXiv論文:多指ロボットが触覚と映像で長い作業——ADEPT、2種類の実機へ直接転移arXiv(未査読プレプリント)
- AI研究arXiv論文:長文AIを教師の言い回しだけでなく課題達成度でも学習——5評価平均を最大11.39点改善arXiv(未査読プレプリント)
- ClaudeAnthropic、AIの使い方を学べる「Claude Academy」を公開——無料教材と修了バッジを提供Claude by Anthropic
- ClaudeClaude Platform、画面操作・Skills・Files APIを正式提供——ブラウザ構造も読んで操作Anthropic(Claude公式ブログ)
11件
- AI研究arXiv論文:自己改善AIは課題の順番で成績が変わる——複数回実行と並べ替えで弱点を検証arXiv(未査読プレプリント)
- AI研究arXiv論文:文書AIの『見ている版』ずれを防ぐStagedWorkspace——OfficeQAで最大12.1点改善arXiv(査読中プレプリント)
- AI研究arXiv論文:画像生成の計算を10分の1にするOYS——5ステップで50ステップの品質89〜94%arXiv(未査読プレプリント)
- AI研究arXiv論文:4K画像を61秒で編集するEditBridge——2K処理は3.6〜8.4倍高速化arXiv(未査読プレプリント)
- ChatGPTChatGPT、欧州31市場に広告を拡大——8月24日開始・回答とは見分けやすく表示OpenAI / Reuters
- ClaudeAnthropicの『Claude』、15種の標的中14種でタンパク質結合体の設計に成功Anthropic Research
- AIニュースCerebras、新システム『CS-4』を発表——GPU比で最大30倍の推論速度Cerebras / The Next Platform
- AIニュースOpenAI、最上位AI『Astra』の推論に監視コストを約20%上乗せThe Register
- AIニュースエヌビディアH200、中国へ初の大量出荷——ByteDanceとTencentに各1万枚Financial Times
- AIニュースLinear、課題の約半分をAIが作成——コーディングAI利用チームはPRが111%増Linear (How teams build)
- OpenAI APIOpenAI、最先端モデルでも入力・回答を残さないZDRを提供——暗号化したまま不正利用を検知OpenAI
1件
7件
- AI研究arXiv論文:操作できる動画世界モデルをAIプレイヤーで評価——PlayWorld、9モデルが長期課題で苦戦arXiv(査読前論文)
- AI研究arXiv論文:AIは証明付きソフトをリポジトリ単位で作れるか——Vero、最強構成も43件中27件arXiv(査読前論文)
- AI研究arXiv論文:小学5年超の知識を除いてAIを学習——LittleLearner、知識獲得を追える実験環境arXiv(査読前論文)
- AI研究arXiv論文:動画AIが「今」と「過去」を両立——StreamTTT、4Bで8Bモデル級arXiv(査読前論文)
- AI研究arXiv論文:研究AIは「発明家」より「改善役」——7モデル・36長期課題で検証arXiv(査読前論文)
- AI研究arXiv論文:許諾されたデータだけで1B言語モデルを学習——Mimir v1、デンマーク語で最高水準arXiv(査読前技術報告)
- AI研究arXiv技術報告:操作型の動画世界モデルAlayaWorld更新——3D点群の記憶で長時間の一貫性を改善arXiv(査読前技術報告)
7件
- AI研究arXiv論文:AIが論文ポスター制作の手順自体を改善——AutoDesign、平均スコアを12.4点向上arXiv(査読前論文)
- AI研究arXiv論文:AI科学者が画像・音声・3Dなど生データから論文作成——OmniScientist、36課題を完走arXiv(査読前論文)
- AI研究arXiv論文:動画生成AIの圧縮表現を意味重視に——V-RAE、学習収束を最大6倍高速化arXiv(査読前論文)
- AI研究arXiv論文:コーディングAIは同じ命令でも実行経路で成績急落——QuoteBench、最大73.2ポイント低下arXiv(査読前論文)
- AI研究ISWC 2026論文:議会記録RAGが発言者の専門性と政党の幅を考慮——引用の正確さ1.00arXiv(ISWC 2026 In-Use Track採択論文)
- AI研究ECCV 2026 Workshop口頭論文:画像AIの例示はいつ1本のタスクベクトルに圧縮できるかを整理arXiv(ECCV 2026 Workshop口頭採択論文)
- AI研究ECCV 2026口頭論文:3D視覚AIの情報を「ばらつき」でなく「範囲」で削減——CoverPrunearXiv(ECCV 2026口頭採択論文)
8件
- AI研究arXiv論文:ドローンAIが過去を覚え、数手先を考えて飛行——DreamFlyが未知環境でも改善arXiv(査読前論文)
- AI研究arXiv論文:AIエージェントはAPIをまたぐと急失速——VAKRA、深い推論で性能50%以上低下arXiv(査読前論文)
- AI研究arXiv論文:動画生成AIが自分で指示と設定を改善——人の比較で最大69%支持arXiv(査読前論文)
- AI研究COLM 2026論文:AI同士が文章を介さず内部状態で連携——StateBridge、26条件中22で最高級arXiv(COLM 2026採択論文)
- AI研究AIES 2026論文:AI安全は規則か性格づけか——規模より未知状況での崩れやすさが重要arXiv(AIES 2026採択論文)
- AI研究ECCV 2026論文:人型ロボットの動きを153時間で評価——HumanTrackerが足滑りも判定arXiv(ECCV 2026採択論文)
- AI研究COLM 2026論文:AI学習で効く文章は途中で変わる——初期は文学、後期はSTEMが強く影響arXiv(COLM 2026採択論文)
- GitHub CopilotGitHub Copilotに「Grok 4.6」追加——長時間のコーディングと道具操作向けGitHub Changelog
7件
- AI研究IJCAI/ECAI 2026 Workshop論文:危険を止めた時点だけ教えて安全AIを学習——RCIが違反率を低減arXiv(SPAI 2026 / IJCAI/ECAI 2026 Workshop採択)
- AI研究ECCV 2026論文:画像AIが文脈を無視する弱点を補正——物体の幻覚率を36%低減arXiv(ECCV 2026採択)
- AI研究ICML 2026論文:異常動画なしで監視AIを学習——文章を時系列映像の代わりに使うTD-VADarXiv(ICML 2026採択)
- 研究論文arXiv論文:強いAIが作った実行用ハーネスで小型AIを再学習なしに強化——平均成績0.49から0.91arXiv(AI4AI at Test-Time)
- 研究論文arXiv論文:企業のChatGPT利用を1500社・1700万件超で分析——若手ほど利用密度が高いarXiv(How Organizations Use AI)
- 研究論文arXiv論文:悪意あるAIスキルが正解を保ったまま処理を遠回り——時間92.45%増の攻撃を検証arXiv(Convergent Detour Hijacking)
- GitHub CopilotGitHub Copilotに「Gemini 3.7 Flash」——Web・アプリ開発と検証を改善GitHub Changelog
12件
- GitHub CopilotMicrosoft「MAI-Code 1.1」公開——CLI成績22%向上、価格75%減Microsoft AI 公式
- GitHub CopilotGitHub CopilotのJetBrains版、会話をまたぐ記憶とOllama接続に対応GitHub Changelog 公式
- GitHub CopilotGitHub Copilot、AI料金の元になるトークン数をモデル別に表示GitHub Changelog 公式
- SHEarXiv論文:AIエージェントの安全設定を失敗から更新——攻撃成功率を3.1分の1へarXiv(cs.AI、未査読・学会採択記載なし)
- Sci-VBenchCOLM 2026論文:科学動画AIは見た目が良くても因果を誤る——16モデル・1253例で評価COLM 2026/arXiv(cs.CV)
- Stealing Reasoning TracesarXiv論文:暗号化したAIの推論記録を別モデルで復号——公開ログ31万件超から認証情報も検出arXiv(cs.CR、未査読・学会採択記載なし)
- AI研究arXiv論文:手術動画でロボットを事前学習——4課題の平均成功率63.5%から77.8%へarXiv(cs.RO)
- AI研究arXiv論文:数学研究AIが未解決定数の境界を更新——専門家が新規と認める着想を提示arXiv(cs.AI)
- AI研究arXiv論文:画面操作AIが失敗を振り返り自己改善——6評価で平均精度7.4%向上arXiv(cs.CV)
- Catastrophic RememberingarXiv論文:AI用の指示書は寿命中に226%肥大化——理由をコメントで残すと余分な指示を99.3%削減arXiv(cs.AI、未査読)
- SkillZiparXiv論文:AIエージェントの手順書を実行テストなしで圧縮——SkillZipが例外を残して重複を整理arXiv(cs.AI、未査読)
- V-FiLLMarXiv論文:金融表を読むAIは計算が深いと精度最大51%低下——正解を計算で保証するV-FiLLMarXiv(cs.AI、査読中)
18件
- CoinRAGarXiv論文:長文RAGを細かな『情報の粒』で高速化——CoinRAG、同じ待ち時間で回答品質を平均5.3%改善arXiv(cs.CL、未査読)
- SkillProxarXiv論文:AIエージェントの手順書を失敗から自動改善——SkillProx、最強比較法より平均3.0ポイント向上arXiv(cs.AI、未査読)
- SynthExarXiv論文:AIが複雑な天然物の合成計画を複数案から改善——専門家が主要工程を人の発表例と同等と評価arXiv(cs.MA、未査読)
- ChatGPT月125ドル・利用量5倍の上位席、ChatGPT Businessに追加OpenAI公式
- OpenAI承認制で提供、OpenAIのサイバーAI「GPT‑5.6‑Cyber」OpenAI公式
- GitHub CopilotGitHub Copilot Web版、会話を最小化——メッセージ別の利用量も表示GitHub Changelog
- TEPAarXiv論文:古い記憶を無効化するTEPA——状況反転テストで0.950arXiv(cs.AI、未査読)
- CoBaarXiv論文:CoBa、精度を保ち計算量指標を58.9%削減arXiv(cs.AI、未査読)
- ResidencyRLarXiv論文:医療AIを模擬診療で訓練——診断精度81%→88%arXiv(cs.AI・cs.CL、未査読)
- Google Ads / Google AnalyticsGoogle広告・Analyticsに分析AI——文章から可視化、同業平均との比較もGoogle公式ブログ
- Muse Glimmer 30BMeta「Muse Glimmer 30B」公開——画像・動画・ツール操作をローカルで扱うApache 2.0モデルHugging Face公式ブログ
- NVIDIA Magpie TTSNVIDIAの音声生成「Magpie TTS」、12言語対応——韓国語・アラビア語・ポルトガル語を追加NVIDIA(Hugging Face公式ブログ)
- TTS評価ベンチマークarXiv論文:音声AIの自動採点は「自然さ」の違いを見分けきれない——860音声・10観点で検証arXiv(cs.SD、Work in progress・未査読)
- MMDiffICML 2026 Workshop論文:画像AIの内部機能を特定して制御——安全攻撃の成功率を24%低減ICML 2026 Trustworthy AI for Good Workshop採択論文(arXiv)
- BDH-CQarXiv論文:150Mの小型AI、ARC-AGI-1で29.5%——1問0.0007ドル相当の推論を報告arXiv(cs.NE、未査読)
- Microsoft CopilotMicrosoft「MAI-Image 2.6」公開——画像内の文字が改善、Arenaで2位Microsoft AI 公式
- OllamaNVIDIA「Nemotron 3.5 Lightning」公開——Ollamaなどで手元実行NVIDIA Blog 公式
- CodexNeMo Switchyard 0.2公開——AI接続を自動選択NVIDIA NeMo公式GitHub Release
9件
- OpenAIOpenAI、次期AI「Astra」のサイバー能力を最高警戒級の可能性——一部の社内作業を停止OpenAI(公式)
- ChatGPTChatGPT無料版、GPT-5.6 Lunaの文章チャットを回数無制限へ——難問向けThinkボタンも追加OpenAI(公式)
- ClaudeClaude Fable 5、生物質問で低性能モデルへ切り替わる回数を約85%削減——危険研究は引き続き制限Anthropic(公式)
- ChatGPTOpenAIと米心理学会、若者のAI利用指針を共同開発——保護者・学校・医療者向け資料を計画OpenAI(公式)
- AI研究arXiv論文:同じAIでもWeb検索で正答率が最大8ポイント低下——同じ質問の回答も最大21%不一致arXiv(cs.HC、未査読)
- AI研究arXiv論文:AI文章の事実を主張ごとに照合するHallDetect——家庭向け機器で4評価中3つの比較法を上回るarXiv(cs.CL、未査読)
- CreativeInstructarXiv論文:AIの創造性を保つCreativeInstruct——人の70.3%が通常の調整済みAIより創造的と評価arXiv(プレプリント、未査読)
- Fisher-R1arXiv論文:統計を任せたAIは計算が動いても結論を誤る——Fisher-R1が425課題で改善arXiv(プレプリント、未査読)
- BAMMISMIR 2026論文:AI音楽の検出は実際のテレビ放送で精度低下——40時間のBAMMで検証arXiv(ISMIR 2026採択論文)
7件
- GitHub CopilotGitHub Code Quality、自動Copilotレビューを初期設定から解除——必要な組織だけ選んで有効化GitHub Changelog(公式)
- 研究論文arXiv論文:長い作業をするAIの「最初の致命的ミス」を追跡——失敗486件を人手で注釈arXiv(cs.AI、未査読プレプリント)
- 研究論文arXiv論文:AIは古い会話に引っ張られ道具選択を32.1%変更——正しい最新状態を学ぶ方法を提案arXiv(cs.AI、未査読プレプリント)
- 研究論文arXiv論文:金融AIは経験で最大19.37点向上——120課題で自己改善と規則違反を評価arXiv(cs.AI、未査読プレプリント)
- 研究論文arXiv論文:コードAIのスキルを関係図で共同更新——テスト生成と誤報除外で再利用性を改善arXiv(cs.SE、未査読プレプリント)
- 研究論文arXiv論文:AI対話で事件直後の陰謀論への信念が低下——米国成人1507人を2実験で比較arXiv(cs.HC、未査読プレプリント)
- 研究論文arXiv論文:780ページの表検索、埋め込みRAGの15.7%に対しREADは58.8%——単位切断を回避arXiv(cs.AI、未査読プレプリント)
14件
- GitHub CopilotGitHub Copilotコードレビュー、軽量・標準の深さを正式提供——PRごとと組織全体で選択GitHub Changelog(公式)
- GitHub CopilotGitHub、Claude・Codexなどエージェント別の利用数をAPIで集計——1日・28日レポートに追加GitHub Changelog(公式)
- GitHub CopilotGitHub Copilot、企業向けMCP許可・拒否リストを正式提供——不明な設定は安全側で遮断GitHub Changelog(公式)
- Gemini NotebooksGemini Notebooks、資料の自動追加に対応——Drive・YouTube・Webを定期ワークフローで更新Google Workspace Updates(公式)
- 研究論文arXiv論文:AIスキルの再利用を3種類の痕跡で監査——3万6446件を調査、F1は0.898arXiv(cs.AI、プレプリント)
- 研究論文arXiv論文:調査AIの長い失敗記録を自動監査——1243件、平均6万5100トークンで原因を特定arXiv(cs.AI、プレプリント)
- 研究論文arXiv論文:音・映像・文章を扱えるAIも矛盾に弱い——人88.64%、最良モデル73.17%arXiv(cs.AI、プレプリント)
- GitHub CopilotGitHub Copilot更新:CLIに/worktreeと/rewind——並行作業と巻き戻し、VS Codeは横質問に対応GitHub Changelog(公式)
- GitHub CopilotGitHub Copilot、費用とPR数を並べるROI欄を追加——給与帯を変えて試算、因果関係には注意GitHub Changelog(公式)
- The Bitter Lesson of Tool Calling(AI研究)arXiv論文:AIの道具操作はJSONよりコードが有利な場合——14モデル中11、長い連鎖で差18.8ポイントarXiv(cs.CL、未査読プレプリント)
- MIST・SCOPE(AI研究)arXiv論文:正しいAIも誤ったヒントで答えを変更——1000問×4条件、全モデルで弱点を確認arXiv(cs.CL、未査読プレプリント)
- CalibForge(AI研究)arXiv論文:AI向け端末課題5431件を難易度調整——強いAIだけ解ける条件で学習効果を向上arXiv(cs.LG、未査読プレプリント)
- 研究論文arXiv論文:AI対戦の強さを中央値で74分の1の試合数で判定——途中終了しても信頼度を保証arXiv(cs.GT・cs.AI、プレプリント)
- 研究論文arXiv論文:AIは自分の作業環境をどこまで改善できるか——5モデル・4課題・111回で評価arXiv(cs.AI、プレプリント)
14件
- WeatherNext 2(Google DeepMind)Google、台風AI「WeatherNext 2」をオープン化——3日先予報が従来の2日先と同等、最大1000通りを計算Google DeepMind(公式)
- Mistral ShieldstralMistral、画像も文章も安全判定する「Shieldstral」公開——30億規模、16GB GPUで動作Mistral AI(公式)
- Reasoning Core(AI研究)arXiv論文:AIの推論教材を50種類の生成器で作成——正解可能でも学習に役立つとは限らないarXiv(未査読プレプリント)
- OctoLong(AI研究)arXiv論文:複数リポジトリをまたぐコード教材「OctoLong」——長文教材の12%置換で理解力が向上arXiv(未査読プレプリント)
- ContextWeave(AI研究)arXiv論文:仕事AIの記憶を1005課題で検証——短い要約より経験豊富な記録が有効、誤記憶には弱いarXiv(未査読プレプリント)
- Agent Plugins 1.0.0Google、AIエージェント部品を1つに束ねる「Agent Plugins 1.0.0」を支持——SkillsとMCPを共通形式で持ち運びGoogle Developers Blog(公式)
- Amazon Bedrock AgentCoreAWS、AIの「行動履歴」で許可を決めるTemporal Policiesを公開——高額操作は毎回人の承認AWS Machine Learning Blog(公式)
- GitHub Copilot / Kimi K3GitHub CopilotにKimi K3追加——ただしActions障害対応で展開を一時停止、入力100万トークン3ドルGitHub Changelog(公式)
- arXiv研究(画像ツール利用の因果監査)arXiv論文:画像を切り抜くAIは「見たふり」も——6モデル・5評価で、画像が回答に効かない失敗を確認arXiv(cs.AI、査読前論文)
- arXiv研究(ベンガル手話認識)arXiv論文:0.48MBの手話認識AIをスマホで実行——1万874枚を専門家確認、1画像3.98ミリ秒arXiv(cs.CV / cs.AI、査読前論文)
- ACM Multimedia 2026研究(動画物体数え上げ)ACM Multimedia 2026論文:混雑動画の数え間違いを62.01%削減——奥行きと重複除外を組み合わせACM Multimedia 2026採択論文 / arXiv
- 動画言語モデルの時間理解(AI研究)arXiv論文:動画AIは速い出来事の数え上げに弱い——2190本で検証、高頻度では正答0.2%arXiv(cs.AI、査読前プレプリント)
- GAUGE(AI研究)arXiv論文:動画生成AIは見た目が自然でも物理量を誤る——22課題でシミュレーターと比較arXiv(cs.AI・cs.CV・cs.RO、査読前プレプリント)
- G-STEER(AI研究)arXiv論文:調査AIの確認質問を約3分の1に——目的と根拠を整理して依頼文を改善arXiv(cs.AI・cs.CL、査読前プレプリント)
8件
- GeminiGoogle Classroom、Geminiで課題ごとの評価表を直接作成——先生が確認・編集して追加Google Workspace Updates(公式)
- SeGaBench(AI研究)arXiv論文:AIがコンパイラの見逃した高速化を発見——最良モデルは93.3%の課題で性能向上に成功arXiv(未査読プレプリント)
- ContinualSkillBench(AI研究)arXiv論文:AIエージェントの「スキル蓄積」は常に効くとは限らない——5分野500課題で検証arXiv(未査読プレプリント)
- 推論AIの評価方法(AI研究)arXiv論文:AIの「考える量」を同じ予算だけで比べるのは危険——推論法を3種類に整理arXiv(未査読プレプリント)
- Google Cloud API GatewayGoogle、3種類の生成AIを1つの入口で切り替え——モデル振り分けを公開プレビューGoogle Developers Blog(公式)
- ABSeeker(AI研究)arXiv論文:40億規模の検索AIが約300億規模に匹敵——8,500例と「答えから逆算する採点」で学習arXiv(未査読プレプリント)
- IRT for AI Safety(AI研究)arXiv論文:AI安全性テストを約10問まで圧縮できる場合——192モデル・8評価を項目反応理論で分析arXiv(未査読プレプリント)
- SciCode-Verified(AI研究)arXiv論文:科学コードAIの低得点はテスト側の欠陥が原因——65課題を修正すると正答率84〜98%arXiv(未査読プレプリント)
18件
- AIエージェント障害検知(AI研究)arXiv論文:AIエージェントの失敗を約200マイクロ秒で検知・再実行——成功率52%から73%へarXiv(未査読プレプリント)
- ParEvalLayer(AI研究)AIMLSystems 2026論文:AI評価は課題の15〜25%で結論できる場合も——途中点だけの公表に警鐘arXiv/AIMLSystems 2026採択論文
- 深掘り調査ベンチマーク(AI研究)arXiv論文:深掘り調査AIを500課題・31分野で検証——根拠確認まで追える評価データを公開arXiv(未査読プレプリント)
- EduZone(AI研究)arXiv論文:学校向けAIの安全性を10モデルで検証——教育特有の危険と長い会話に弱さarXiv(審査中プレプリント)
- Harness-R1(AI研究)arXiv論文:AI本体を変えず「実行の仕組み」を失敗から修正——成功率44.3%から53.6%へarXiv(未査読プレプリント)
- AtumAI(AI研究)arXiv論文:データセンターの運用ルールをAIが設計——配置・増減・電力の3課題で専門家案を上回るarXiv(未査読プレプリント)
- GitHub CopilotGitHub Copilotのクラウドエージェント、課題ごとに「考える量」を選択可能——高設定はAIクレジット増に注意GitHub公式Changelog
- GitHub CopilotGitHub Copilot、自動化をIssue・PRコメントから起動——文書更新、エラー調査、後続課題の作成に対応GitHub公式Changelog
- GeminiGoogle ClassroomのGemini、年齢制限を拡大——8月10日から小中高生も授業資料でクイズ・暗記カードを作成Google Workspace Updates公式ブログ
- Gemini in Google MeetGoogle MeetのAI議事録、共有画面のスクリーンショットを自動追加——グラフや図の説明不足を補完Google Workspace Updates公式ブログ
- AI予測評価(AI研究)arXiv論文:検索できる最先端AIのW杯勝敗予測は平均63.9%——ブックメーカー本命と同水準、AI多数決も効果なしarXiv(未査読プレプリント)
- 音声・文字入力のAI耐性(AI研究)arXiv論文:AIへの音声入力は文字入力より回答精度を下げやすい——考える量を増やしても音声の弱さは残るarXiv(未査読プレプリント)
- Claude Platform on AWSAWSだけで“本家Claude”を契約——Claude Platform on AWS一般提供、ただしデータはAWS境界外AWS公式Machine Learning Blog
- Genspark GenOfficeGenspark、AI版Officeを丸ごと公開——Word・Excel・PowerPoint・PDFを1つに、ソースコードもApache 2.0Genspark公式GitHub
- LFM2.5-2.6B(Liquid AI)スマホで毎秒30トークン、2.5GB未満——Liquid AIの2.6B小型AIが128K文脈とツール操作Liquid AI公式ブログ
- Gemini NotebooksGeminiに“案件ごとの頭脳”——NotebookLMと双方向同期、Pro・Plusにも展開Google公式ブログ
- DALL·E 2 / DALL·E 3DALL·E 2・3 APIは終了済み——旧画像生成コードは移行必須、後継はGPT ImageOpenAI Developer Community公式廃止案内
- Microsoft Copilot in ExcelExcel Copilotが“AIを選べる表計算”へ——GPT-5.6とClaude Opus 5、Autoも用意Microsoft 365 Copilot公式ブログ
7件
- MANTA(AI研究)arXiv論文:複数AIが仕事中に「チーム編成」を組み替えるMANTA——5評価の平均74.0で従来最高を5.8ポイント上回るarXiv(未査読プレプリント)
- Qwen-UI-Agent(AI研究)arXiv:Qwenの画面操作AI、実機で成功率92.2%——1万環境で100手超を学習arXiv(未査読技術報告)
- MIND(AI研究)arXiv論文:AIの「記憶」に混ぜた攻撃指示を軽量検出——MINDは攻撃成功率を約55%減らし、速度を維持arXiv(未査読プレプリント)
- ExtractBench(AI研究)arXiv論文:企業文書を読むAIを4869ページで比較——長い一覧は欠落しやすく、精度と費用に大差arXiv(未査読プレプリント)
- SafeKeep(AI研究)arXiv論文:AIに道具の仕様を渡すだけで拒否が弱まる——SafeKeepは攻撃成功率を25.6%から2.5%へarXiv(未査読プレプリント)
- ANCHOR(AI研究)arXiv論文:長く話す相棒AI、過去の流れを覚える正確さは平均44.4%——4モデルで人格維持も不安定arXiv(未査読プレプリント)
- GitHub CopilotGitHub、Copilot Billing Previewを本日終了——AI利用量・予算管理は標準の請求画面へ移行GitHub公式Changelog
6件
- ORCA-bench(AI研究)arXiv論文:本番障害を調べるAI、現実的な設定で正答25.3%——難しい課題は10.0%arXiv(未査読プレプリント)
- InfoOps Bench(AI研究)arXiv論文:情報工作へのAIの拒否率は8.8〜94.5%——17モデルを実例2100件超で検証arXiv(未査読プレプリント)
- OSReward(AI研究)arXiv論文:パソコン操作AIの採点モデルは失敗を成功と見なしやすい——低コスト判定AIを公開arXiv(作業中・未査読プレプリント)
- ローカルPC操作AI研究arXiv論文:手元で動くPC操作AI、履歴を増やしても成功率は28.56%で頭打ち——長く考えさせても効果薄arXiv(未査読プレプリント)
- Change2Task(AI研究)arXiv論文:実際のコード変更からAI向け課題を自動再現——Change2Taskは検証済み課題を29.2%多く回収arXiv(未査読プレプリント)
- SaliTrap(AI研究)arXiv論文:AIは目立つ数字に引っぱられ常識を無視——12モデル中、最良でも罠を避けたのは54.8%arXiv(未査読プレプリント)
7件
- AISPA(AI研究)arXiv論文:商用AI 88製品のシステム指示を監査——約4割に利用者の利益とぶつかる指示arXiv(未査読プレプリント)
- Computer-Use Agent評価研究arXiv論文:パソコン操作AIの「失敗」判定15.3%が誤り——5ベンチマーク150件を再監査arXiv(未査読プレプリント)
- 画像モデレーション評価研究arXiv論文:画像AIの安全判定、白黒化や色反転でも回避可能——商用3サービスを横断検証arXiv(未査読プレプリント)
- ReToken(AI研究)arXiv論文:長い動画を読むAI、必要な映像だけ選ぶ「1トークン」で精度向上——単一H100で学習・推論arXiv(未査読プレプリント)
- AskChem(AI研究)arXiv論文:化学論文14.7万本を「根拠付き主張」240万件へ分解——AI検索基盤AskChemを公開arXiv(未査読プレプリント)
- Sample More, Reflect Less(AI研究)arXiv論文:AIの「反省・書き直し」、同じ文字数なら単純な複数回答に勝てず——36比較で検証arXiv(未査読プレプリント)
- Astra(OpenAI研究)OpenAI研究発表:AIが数学・理論計算機科学の未解決問題10件を前進——Leanで証明を機械検証、探索費用は約2000ドルOpenAI Research(研究発表・論文)