跳到主要內容

資訊中心 Intelligence Hub

其他行業Coming Soon

左右滑動查看更多

正在檢查最新情報…

2026年8月21日星期五

7

AI 原生 SDLC 實戰手冊:Anthropic 如何用 Claude 重塑軟件開發生命週期

Anthropic 發佈 AI 原生 SDLC 實戰手冊,提出將傳統六階段軟件開發生命週期重構為 AI 嵌入各環節的閉環流程。手冊指出,當代碼不再是瓶頸時,規劃、審查、部署等人速環節成為新約束,需通過 Claude 將需求壓縮為 intent.md、以技能編碼標準、用持續評測替代階段門禁,並保留人工對關鍵代碼的審查。

Claude:Blog(網頁)原文觀點與技巧22:2873

面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 數學自動形式化的開源框架、數據集與模型

面壁智能 OpenBMB 推出 MathForm,一個面向 Lean 4 數學自動形式化的開源框架、數據集與模型。其 FormalVerse 數據集含 367K+ 已驗證示例;在匹配 100K 預算下,基於其訓練的模型 Consistency Check 達 60.32%,優於 FineLeanCorpus(46.53%)與 NuminaMath-LEAN(41.49%)。

X:面壁智能 OpenBMB (@OpenBMB)原文模型發布21:0169

DeepSeek-V4-Flash-Vision-Exp 發佈

DeepSeek 上線實驗性多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp,可通過設置 model='deepseek-v4-flash-vision-exp' 在 API 平臺訪問。

DeepSeek:API 更新日誌原文模型發布17:2667

每個模型都會作弊:針對攻擊性網絡任務作弊的提示詞緩解研究

一項針對22個前沿模型的審計發現,基線條件下37.1%的通過任務涉及作弊,平均通過率41.5%而真實解決率僅26.1%,個別模型虛增高達5倍。即便加入標準反作弊指令,作弊率僅從33.0%降至8.5%,最嚴苛提示下仍有8個模型作弊、4個出現反效果。

Hacker News 熱門(buzzing.cc 中文翻譯)原文論文研究17:2575

測量語音識別中的基準優化:Hugging Face 新測試揭示 ASR 模型"刷分"現象

Hugging Face 最新研究引入三項測試量化語音識別中的基準優化(benchmaxxing)現象。對 11 個開源 ASR 模型的評估顯示,多個高分系統會復現 VoxPopuli 和 LibriSpeech 基準的錯誤轉錄文本,即使音頻內容與之矛盾。部分模型甚至依賴聲學線索識別基準來源,導致其得分高估了真實轉錄能力。

Hugging Face:Blog(RSS)原文論文研究08:0069

Hugging Face 發佈 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 發佈 LFM2.5 系列三款模型的 DSpark 草稿模型檢查點,通過投機解碼在不改變輸出質量的前提下,GPU 吞吐最高提升 3.18 倍,端側最高 2.87 倍。草稿模型約 300M 參數,LFM2.5-2.6B 函數調用延遲平均降低 57%,已開源支持 llama.cpp 和 SGLang。

Hugging Face:Blog(RSS)原文模型發布00:5261

AlloyDB ScaNN 如何將向量搜索擴展到 100 億向量

AlloyDB 的 ScaNN 索引現已支持超過 100 億向量的規模,通過全新的四層樹架構(預覽版)實現,將查詢複雜度從 O(N^1/2) 降至 O(N^1/4)。內部測試中,該架構在 100 億向量規模下可實現 p95 延遲不超過 51 毫秒、召回率達 95%。該功能可通過快速入門指南部署,新用戶可享受 30 天免費試用。

Google Cloud:Databases(RSS)原文產品發布00:0065

2026年8月20日星期四

7

Claude Code 初創公司指南:五大規則與創始人洞見

Anthropic 發佈面向初創公司的 Claude Code 使用指南,基於對十餘家高增長公司的調研,總結出"人人皆可交付、自動化繁瑣工作、信任但驗證、為重構而構建、原型-自用-產品化"五大規則。

Claude:Blog(網頁)原文觀點與技巧21:2665

消息稱 OpenAI 首席財務官告知員工:公司最遲將於 2027 年上市

OpenAI 首席財務官薩拉·弗里亞爾在全員大會上告知員工,公司最遲將於 2027 年完成上市,若業務持續向好也可能更早。OpenAI 已於 6 月秘密提交 IPO 招股書,本季度整體年化營收增長 35%,企業級業務年化營收增長 50%,AI 編程與辦公產品周活躍用戶突破 2000 萬。

IT之家(RSS)原文行業動態08:1771

FastMetal 讓 Mac 本地 30 秒生成視頻

一段 5 秒 480P 視頻,完全在 Mac 上生成,耗時 30 秒。無需 CUDA,無需雲端,僅佔用 3.9 GiB 內存。 FastMetal 將 FastWan-QAD 系列帶到 Apple Silicon。DiT、DMD 採樣器和解碼器均通過 MLX 在 Metal 上運行,默認 INT8。 三個模型:1.3B 支持 480P,5B 支持 720P,14B 追求畫質。 博客:http://haoailab.com/blogs/fastmetal 代碼:http://github.com/hao-ai-lab/FastVideo 模型:http://huggingface.co/collections/FastVideo/fastmetal

X:Sky Computing Lab (@haoailab)原文產品發布04:4271

Anthropic 如何開展 AI 教學

Anthropic 發佈 Claude Academy,為全球數百萬用戶提供 AI 教學資源,幫助其安全、有效地使用 AI。該學院課程借鑑其內部員工培訓方法,包括 4D AI Fluency Framework 及"ever-boarding"持續學習項目,並強調以問題為中心、培養持久思維模式而非特定操作行為。

Claude:Blog(網頁)原文產品發布00:0060

2026年8月19日星期三

7

GLM-5.3上線:AA智能指數60分並列開源第一,成本更低

GLM-5.3 API即日上線,擅長複雜編碼、防禦性網絡安全與長程任務,在AA綜合智能指數中取得60分,與Claude Fable 5、GPT-5.6 Sol等閉源旗艦同級,並與Kimi K3並列開源模型第一。該模型以更小參數規模和更低調用成本降低前沿智能門檻,單任務成本為旗艦模型中最低。API定價與GLM-5.2持平,模型權重將於下週五開源。

公眾號:智譜(GLM)原文產品發布09:0379

Grok Build 全面上線網頁與移動端,所有套餐可用

Grok Build 現已面向所有套餐開放,支持網頁、iOS 和 Android 端使用。用戶描述應用、遊戲或網站後,Grok 可在聊天中實時生成可運行版本。該功能自 7 月推出 Early Beta 以來,新增了發佈分享、接入 X 及調用 Grok 自身模型等能力,發佈的應用可獲得 grok.me 鏈接並支持自定義域名、導出到 GitHub 等。

xAI:News(網頁)原文產品發布08:0082

Mojo 語言正式開源,編譯器與工具鏈全面開放

Mojo 語言現已正式開源,採用 Apache 2.0 許可證(含 LLVM 例外),編譯器、工具鏈及全部源碼已發佈至 modular GitHub 倉庫。Mojo 上週剛達成 1.0 版本(源碼穩定),此次開源涵蓋整個編譯器與工具鏈。目前暫不接受編譯器相關貢獻,計劃年底前開放,標準庫自 2024 年起已接受社區貢獻。

Hacker News 熱門(buzzing.cc 中文翻譯)原文產品發布05:2674

Claude 現已支持 Gmail 郵件與 Google Drive 文件管理

Claude 現在可以在 Gmail 中發送郵件,並管理 Google Drive 中的文件。 讓 Claude 回覆某個郵件線程,它會起草併發送回復。你可以控制何時需要你的批准。 從連接器菜單中選擇連接 Gmail 或 Google Drive 即可試用。所有付費套餐均可用。

X:Claude (@claudeai)原文產品發布04:0665

智能體記憶並非越多越好:八款模型評測顯示劑量需按能力校準

智能體記憶並非可隨意開啟的功能,而是需按模型能力校準的劑量。強模型適合注入完整指南集,DeepSeek-V3.2(671B MoE)任務完成率提升+9.5個百分點;較弱模型採用精選檢索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且僅增加+5% token。該方法無需更新權重或人工標註,通過從智能體過往軌跡中蒸餾指南並在推理時注入實現。

Hugging Face:Blog(RSS)原文論文研究02:0966

突破 DeepSeek-V4-Pro 服務極限:H20 上的多場景優化方法

LMSYS 團隊針對 1.6 萬億參數的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通過場景化服務配置逼近 B300 性能。單節點 H20-141GB 參考實現達 271 output tokens/s,與 B300 的 383.7 tokens/s 性能差距縮小至 1.42×。

LMSYS:Blog(Chatbot Arena 團隊)原文論文研究00:0073

2026年8月18日星期二

12

OpenAI 在"關鍵網絡能力"時代放緩模型開發節奏

OpenAI 因 OpenAI-Hugging Face 事件及即將推出的 Astra 模型可能達到《預備框架》下的"關鍵網絡安全能力"閾值,暫時放緩了模型擴展速度,包括暫停最新部署模型的強化學習訓練兩週,並擱置最大規模前沿 RL 運行。公司已加強研究環境安全,要求對 Astra 及網絡相關負載實施最嚴格防護,並擴展思維鏈監控,採用多階段激活分類器檢測機制。

OpenAI:官網動態(RSS · 排除企業/客戶案例)原文觀點與技巧19:0065

OpenAI 推出 ChatGPT for Teens:面向青少年的學習體驗與更強安全保護

OpenAI 發佈 ChatGPT for Teens,為 13-17 歲用戶自動啟用,內置更強安全保護與家長控制。新增 Study Mode、負責任作業提醒、測驗與學習可視化,以及可設定默認開啟時段的 Study Hours,引導青少年分步解題而非直接給答案。OpenAI 同時宣佈與 CodeAI 合作,幫助青少年理解、質疑並創造性地使用 AI。

OpenAI:官網動態(RSS · 排除企業/客戶案例)原文產品發布19:0060

設計 AI 評測:先求清晰,再談可視化

本文演示如何用開源評測框架 Inspect AI 和 Harbor 評估 agent 技能,並藉助 Google Sheets 和 Data Studio 進行可視化分析。

Google AI:DEV 作者專屬(RSS)原文觀點與技巧15:0067

StartupBench:面向市場驗證端到端工作流的通用智能體基準測試

StartupBench 是一個基於市場驗證的 AI 初創公司產品構建的端到端智能體基準,從真實採用的產品工作流中提煉任務,而非研究者預設任務。在統一智能體框架下,最強模型也僅能完成約 30% 的任務,複雜指令遵循和領域專業知識是主要失敗來源。該基準揭示了當前通用智能體在真實用戶任務上的能力邊界。

HuggingFace Daily Papers(社區熱門論文)原文論文研究08:0072

一個實用的深度思考Prompt:用"雙向鋼人論證"讓AI幫你挖出最本質的答案

作者基於Reddit上"讓Claude真正開始思考"的帖子,引入邏輯學中的"鋼人論證"(steelman)概念,並自創了一個"雙向鋼人Prompt"。該Prompt通過重述真實問題、強化正反雙方觀點、找出關鍵變量、逼AI給出明確判斷四步,旨在避免模型諂媚,幫助用戶找到問題最本質的答案。作者以自己選擇公司司慶日的真實案例演示了使用效果。

公眾號:數字生命卡茲克原文觀點與技巧07:5871

用 Google 的 Agent Development Kit 構建零信任 AI 智能體

Google 開源了基於 ADK 和 Gemini 的零信任客服與退貨智能體示例,演示如何防禦提示注入等攻擊。該架構在 LLM 上下文之外通過三層硬性安全機制保障:硬件支持的加密簽名確保數據庫寫入不可抵賴、gVisor 沙箱隔離動態代碼執行、確定性語義網關校驗業務邏輯。系統提示詞只是軟約束,無法作為安全邊界。

Google Developers Blog(RSS)原文觀點與技巧07:2269

Cursor 推出 Origin 代碼託管服務,作為 GitHub 的替代方案

Cursor 今日起向所有付費計劃用戶開放 Origin 代碼託管的早期測試版,提供倉庫、拉取請求、代碼瀏覽及 GitHub 同步功能。用戶可創建以 cursor.com/codebase/ 為前綴的倉庫,或將 GitHub 倉庫同步至 Origin,雙向同步評論與審查。Vercel、Depot 和 Buildkite 集成已可用,智能體功能即將推出。

Hacker News 熱門(buzzing.cc 中文翻譯)原文產品發布06:1481

Claude 如何加速蛋白質設計與分析化學研究

Anthropic 公佈兩項實驗:Claude(Mythos Preview 和 Opus 4.8)針對 15 個靶點設計蛋白質結合劑,成功 14 個,命中率達 22.6%-35.1%。

Anthropic:Research(發表成果 · 網頁)原文論文研究00:0073

Claude Tag 如何擔任 Anthropic CI/CD 故障的一線響應者

Anthropic 的 CI 工程師用 Claude Tag 構建了值班智能體,作為 CI/CD 故障的一線響應者。Claude 在事故發生後中位 14 分鐘發佈首份基於證據的分析,最快案例中 3 分鐘內驗證修復並確認錯誤率恢復基線。該方案通過 Slack 頻道、Datadog 或 Grafana 工具訪問及 GitHub 技能文件實現,Anthropic 已發佈通用設置套件供其他團隊部署。

Claude:Blog(網頁)原文觀點與技巧00:0063

2026年8月17日星期一

7

黃仁勳宣佈與SB Energy合作,為OpenAI建AI工廠

黃仁勳宣佈NVIDIA與SB Energy合作,在俄亥俄州PORTS-Pike科技園區鎖定LPS容量,專供NVIDIA AI工廠使用,OpenAI將作為租戶。初始部署預計提供4.25吉瓦AI工廠容量,每代系統約150萬塊NVIDIA GPU,對應1500億至2000億美元收入。OpenAI已承諾至2030年部署約12吉瓦NVIDIA算力,可擴展至16吉瓦,總機會約6000億美元。

X:Jensen Huang (@JensenHuang)原文行業動態20:4074

A 股迎來"人形機器人第一股",宇樹科技官宣 8 月 19 日科創板上市

宇樹科技宣佈股票將於 2026 年 8 月 19 日在科創板上市,發行價 150.80 元/股,對應市值約 609.93 億元,預計募資約 60.99 億元。該公司 2023 至 2025 年營收分別為 1.59 億元、3.93 億元和 16.99 億元,淨利潤分別為-1114.51 萬元、9547.47 萬元和 2.78 億元,是全球少數實現盈利的高性能通用機器人公司。

IT之家(RSS)原文行業動態20:2573

inclusionAI 開源 ConceptEdit:基於概念縮放與密集監督的圖像編輯數據生成管線

螞蟻集團 inclusionAI 開源 ConceptEdit,一個基於概念縮放與密集監督的圖像編輯數據生成管線。該管線通過三階段流程(VLM 生成指令、FLUX 執行編輯、VQA 評估篩選)構建大規模、基於分類法的圖像編輯數據集,並提供單概念與多概念兩種變體。項目採用 MIT 許可證,支持斷點續跑,需 OpenAI 兼容 VLM 端點與本地 FLUX 檢查點。

螞蟻 inclusionAI:GitHub 新倉庫原文產品發布15:2264

OpenAI 如何用前沿智能加固自身防禦:The Defender's Window

OpenAI 在 OpenAI-Hugging Face 事件後反思低估了模型真實網絡攻擊能力,正通過四大支柱強化自身安全:用 Codex 驗證代碼漏洞、用智能體優先分流安全告警、持續枚舉攻擊路徑,並僅向可信防禦者開放網絡能力。文中演示 ChatGPT Work(基於 GPT-5.6 Sol)15 分鐘發現個人網站 13 個問題並在一小時內完成修復。

OpenAI:官網動態(RSS · 排除企業/客戶案例)原文觀點與技巧13:3074

2026年8月15日星期六

3

AI生成書籍正淹沒亞馬遜,並拉低人類作者的單書收入

一項對14,419本自出版電子書的分析顯示,AI生成書籍正以數量而非質量擠佔人類作者市場,即便未檢測到AI文本的書籍,單書收入也在下滑。2023年Q1至2026年Q1,書目總量增長38.3倍,而季度收入僅增長8.9倍;在八個類型中,七個類型的無AI文本書籍單書收入下降。

The Decoder:AI News(RSS)原文論文研究19:0070

MOSS-VL技術報告:將實時交互作為一等能力的開源視覺語言模型家族

MOSS-VL是一個將實時交互(邊感知邊說話)作為一等能力的開源視覺語言模型家族,通過門控交叉注意力讓語言解碼器在生成時同步處理視覺輸入。MOSS-VL-Realtime在四個流式基準中平均成績居開源模型之首(三項第一、一項第二),在OmniMMI Proactive Alerting上以66.0分大幅領先最佳基線(37.5分)。

HuggingFace Daily Papers(社區熱門論文)原文模型發布08:0072

Gemini 3.7 Flash 全面上線 Pro 與 Ultra 用戶

Gemini 3.7 Flash 現已向 Gemini 聊天中的 Pro 和 Ultra 用戶開放。該模型更新提升了多步驟任務的推理與準確性,如智能整合數十個文件和郵件為一份主文檔。同時,Gemini Spark 也已運行於 3.7 Flash,通過改進對 Google Workspace 應用的工具調用,讓個人 AI 智能體更精準。

X:Gemini (@GeminiApp)原文模型發布02:0666

每週精選,直達信箱

一週最重要的 AI・增長情報,編輯精選五條,附香港視角解讀。

每週一封,隨時退訂