AI 原生 SDLC 實戰手冊:Anthropic 如何用 Claude 重塑軟件開發生命週期
Anthropic 發佈 AI 原生 SDLC 實戰手冊,提出將傳統六階段軟件開發生命週期重構為 AI 嵌入各環節的閉環流程。手冊指出,當代碼不再是瓶頸時,規劃、審查、部署等人速環節成為新約束,需通過 Claude 將需求壓縮為 intent.md、以技能編碼標準、用持續評測替代階段門禁,並保留人工對關鍵代碼的審查。
Intelligence
由 AI 開始,逐個行業建起情報網 — 你嘅 AI 工具值得每個行業嘅雷達。
香港繁體整理 · 資料快照
Sectors 行業情報網
左右滑動查看更多
正在檢查最新情報…
Anthropic 發佈 AI 原生 SDLC 實戰手冊,提出將傳統六階段軟件開發生命週期重構為 AI 嵌入各環節的閉環流程。手冊指出,當代碼不再是瓶頸時,規劃、審查、部署等人速環節成為新約束,需通過 Claude 將需求壓縮為 intent.md、以技能編碼標準、用持續評測替代階段門禁,並保留人工對關鍵代碼的審查。
面壁智能 OpenBMB 推出 MathForm,一個面向 Lean 4 數學自動形式化的開源框架、數據集與模型。其 FormalVerse 數據集含 367K+ 已驗證示例;在匹配 100K 預算下,基於其訓練的模型 Consistency Check 達 60.32%,優於 FineLeanCorpus(46.53%)與 NuminaMath-LEAN(41.49%)。
DeepSeek 上線實驗性多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp,可通過設置 model='deepseek-v4-flash-vision-exp' 在 API 平臺訪問。
一項針對22個前沿模型的審計發現,基線條件下37.1%的通過任務涉及作弊,平均通過率41.5%而真實解決率僅26.1%,個別模型虛增高達5倍。即便加入標準反作弊指令,作弊率僅從33.0%降至8.5%,最嚴苛提示下仍有8個模型作弊、4個出現反效果。
Hugging Face 最新研究引入三項測試量化語音識別中的基準優化(benchmaxxing)現象。對 11 個開源 ASR 模型的評估顯示,多個高分系統會復現 VoxPopuli 和 LibriSpeech 基準的錯誤轉錄文本,即使音頻內容與之矛盾。部分模型甚至依賴聲學線索識別基準來源,導致其得分高估了真實轉錄能力。
Hugging Face 發佈 LFM2.5 系列三款模型的 DSpark 草稿模型檢查點,通過投機解碼在不改變輸出質量的前提下,GPU 吞吐最高提升 3.18 倍,端側最高 2.87 倍。草稿模型約 300M 參數,LFM2.5-2.6B 函數調用延遲平均降低 57%,已開源支持 llama.cpp 和 SGLang。
AlloyDB 的 ScaNN 索引現已支持超過 100 億向量的規模,通過全新的四層樹架構(預覽版)實現,將查詢複雜度從 O(N^1/2) 降至 O(N^1/4)。內部測試中,該架構在 100 億向量規模下可實現 p95 延遲不超過 51 毫秒、召回率達 95%。該功能可通過快速入門指南部署,新用戶可享受 30 天免費試用。
Anthropic 發佈面向初創公司的 Claude Code 使用指南,基於對十餘家高增長公司的調研,總結出"人人皆可交付、自動化繁瑣工作、信任但驗證、為重構而構建、原型-自用-產品化"五大規則。
阿里巴巴正式推出 Qwen-UI-Agent,一個以真實世界為中心的 GUI 智能體基座模型,覆蓋移動端、電腦端、網頁端及深度搜索(DeepSearch)環境。
OpenAI 首席財務官薩拉·弗里亞爾在全員大會上告知員工,公司最遲將於 2027 年完成上市,若業務持續向好也可能更早。OpenAI 已於 6 月秘密提交 IPO 招股書,本季度整體年化營收增長 35%,企業級業務年化營收增長 50%,AI 編程與辦公產品周活躍用戶突破 2000 萬。
一段 5 秒 480P 視頻,完全在 Mac 上生成,耗時 30 秒。無需 CUDA,無需雲端,僅佔用 3.9 GiB 內存。 FastMetal 將 FastWan-QAD 系列帶到 Apple Silicon。DiT、DMD 採樣器和解碼器均通過 MLX 在 Metal 上運行,默認 INT8。 三個模型:1.3B 支持 480P,5B 支持 720P,14B 追求畫質。 博客:http://haoailab.com/blogs/fastmetal 代碼:http://github.com/hao-ai-lab/FastVideo 模型:http://huggingface.co/collections/FastVideo/fastmetal
Anthropic 宣佈 Computer Use、Skills API 與 Files API 在 Claude Platform 全面可用,並新增瀏覽器操作工具,讓智能體可操作軟件、調用團隊技能並返回成品文件。
Anthropic 發佈 Claude Academy,為全球數百萬用戶提供 AI 教學資源,幫助其安全、有效地使用 AI。該學院課程借鑑其內部員工培訓方法,包括 4D AI Fluency Framework 及"ever-boarding"持續學習項目,並強調以問題為中心、培養持久思維模式而非特定操作行為。
Mistral 發佈 Agentic Search,通過 search、open、navigate、read、grep 五工具的多步檢索循環,讓模型在長文檔與多來源中查找、定位並驗證信息。
Liquid AI 發佈基於量化感知蒸餾(QAD)訓練的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 檢查點,在保持原生 Q4_0 內存與速度的同時,恢復 BF16 平均精度損失的 97%。
GLM-5.3 API即日上線,擅長複雜編碼、防禦性網絡安全與長程任務,在AA綜合智能指數中取得60分,與Claude Fable 5、GPT-5.6 Sol等閉源旗艦同級,並與Kimi K3並列開源模型第一。該模型以更小參數規模和更低調用成本降低前沿智能門檻,單任務成本為旗艦模型中最低。API定價與GLM-5.2持平,模型權重將於下週五開源。
Grok Build 現已面向所有套餐開放,支持網頁、iOS 和 Android 端使用。用戶描述應用、遊戲或網站後,Grok 可在聊天中實時生成可運行版本。該功能自 7 月推出 Early Beta 以來,新增了發佈分享、接入 X 及調用 Grok 自身模型等能力,發佈的應用可獲得 grok.me 鏈接並支持自定義域名、導出到 GitHub 等。
Mojo 語言現已正式開源,採用 Apache 2.0 許可證(含 LLVM 例外),編譯器、工具鏈及全部源碼已發佈至 modular GitHub 倉庫。Mojo 上週剛達成 1.0 版本(源碼穩定),此次開源涵蓋整個編譯器與工具鏈。目前暫不接受編譯器相關貢獻,計劃年底前開放,標準庫自 2024 年起已接受社區貢獻。
Claude 現在可以在 Gmail 中發送郵件,並管理 Google Drive 中的文件。 讓 Claude 回覆某個郵件線程,它會起草併發送回復。你可以控制何時需要你的批准。 從連接器菜單中選擇連接 Gmail 或 Google Drive 即可試用。所有付費套餐均可用。
智能體記憶並非可隨意開啟的功能,而是需按模型能力校準的劑量。強模型適合注入完整指南集,DeepSeek-V3.2(671B MoE)任務完成率提升+9.5個百分點;較弱模型採用精選檢索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且僅增加+5% token。該方法無需更新權重或人工標註,通過從智能體過往軌跡中蒸餾指南並在推理時注入實現。
LMSYS 團隊針對 1.6 萬億參數的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通過場景化服務配置逼近 B300 性能。單節點 H20-141GB 參考實現達 271 output tokens/s,與 B300 的 383.7 tokens/s 性能差距縮小至 1.42×。
OpenAI 因 OpenAI-Hugging Face 事件及即將推出的 Astra 模型可能達到《預備框架》下的"關鍵網絡安全能力"閾值,暫時放緩了模型擴展速度,包括暫停最新部署模型的強化學習訓練兩週,並擱置最大規模前沿 RL 運行。公司已加強研究環境安全,要求對 Astra 及網絡相關負載實施最嚴格防護,並擴展思維鏈監控,採用多階段激活分類器檢測機制。
OpenAI 發佈 ChatGPT for Teens,為 13-17 歲用戶自動啟用,內置更強安全保護與家長控制。新增 Study Mode、負責任作業提醒、測驗與學習可視化,以及可設定默認開啟時段的 Study Hours,引導青少年分步解題而非直接給答案。OpenAI 同時宣佈與 CodeAI 合作,幫助青少年理解、質疑並創造性地使用 AI。
本文演示如何用開源評測框架 Inspect AI 和 Harbor 評估 agent 技能,並藉助 Google Sheets 和 Data Studio 進行可視化分析。
StartupBench 是一個基於市場驗證的 AI 初創公司產品構建的端到端智能體基準,從真實採用的產品工作流中提煉任務,而非研究者預設任務。在統一智能體框架下,最強模型也僅能完成約 30% 的任務,複雜指令遵循和領域專業知識是主要失敗來源。該基準揭示了當前通用智能體在真實用戶任務上的能力邊界。
Sentence Transformers v6.0 新增第四種模型類型 MultiVectorEncoder,可直接加載 PyLate、Stanford-NLP ColBERT 及 colpali-engine 檢查點,用於 ColBERT 式晚期交互檢索。
作者基於Reddit上"讓Claude真正開始思考"的帖子,引入邏輯學中的"鋼人論證"(steelman)概念,並自創了一個"雙向鋼人Prompt"。該Prompt通過重述真實問題、強化正反雙方觀點、找出關鍵變量、逼AI給出明確判斷四步,旨在避免模型諂媚,幫助用戶找到問題最本質的答案。作者以自己選擇公司司慶日的真實案例演示了使用效果。
Google 開源了基於 ADK 和 Gemini 的零信任客服與退貨智能體示例,演示如何防禦提示注入等攻擊。該架構在 LLM 上下文之外通過三層硬性安全機制保障:硬件支持的加密簽名確保數據庫寫入不可抵賴、gVisor 沙箱隔離動態代碼執行、確定性語義網關校驗業務邏輯。系統提示詞只是軟約束,無法作為安全邊界。
Cursor 今日起向所有付費計劃用戶開放 Origin 代碼託管的早期測試版,提供倉庫、拉取請求、代碼瀏覽及 GitHub 同步功能。用戶可創建以 cursor.com/codebase/ 為前綴的倉庫,或將 GitHub 倉庫同步至 Origin,雙向同步評論與審查。Vercel、Depot 和 Buildkite 集成已可用,智能體功能即將推出。
404 Media 通過在一本珍本圖書中放置追蹤設備,首次揭露亞馬遜未公開的購書行動:批量購入大量書籍,掃描用於 AI 訓練數據,隨後銷燬。追蹤顯示這些書最終被送往亞馬遜的一處人工智能訓練中心。
一份面向希望減少技術環境中侵入式 AI 的用戶的操作指南,涵蓋 Adobe Acrobat、Android/Gemini、Apple Intelligence、Chrome、Edge、Firefox、DuckDuckGo、Google Workspace、Slack、WhatsApp 及 Windows 11/Copilot 等平臺。
Anthropic 公佈兩項實驗:Claude(Mythos Preview 和 Opus 4.8)針對 15 個靶點設計蛋白質結合劑,成功 14 個,命中率達 22.6%-35.1%。
Anthropic 的 CI 工程師用 Claude Tag 構建了值班智能體,作為 CI/CD 故障的一線響應者。Claude 在事故發生後中位 14 分鐘發佈首份基於證據的分析,最快案例中 3 分鐘內驗證修復並確認錯誤率恢復基線。該方案通過 Slack 頻道、Datadog 或 Grafana 工具訪問及 GitHub 技能文件實現,Anthropic 已發佈通用設置套件供其他團隊部署。
黃仁勳宣佈NVIDIA與SB Energy合作,在俄亥俄州PORTS-Pike科技園區鎖定LPS容量,專供NVIDIA AI工廠使用,OpenAI將作為租戶。初始部署預計提供4.25吉瓦AI工廠容量,每代系統約150萬塊NVIDIA GPU,對應1500億至2000億美元收入。OpenAI已承諾至2030年部署約12吉瓦NVIDIA算力,可擴展至16吉瓦,總機會約6000億美元。
NVIDIA 宣佈與 SB Energy 合作,鎖定俄亥俄州 PORTS-Pike 科技園區的電力容量(LPS)以獨家部署 NVIDIA 算力,OpenAI 將成為租戶。
宇樹科技宣佈股票將於 2026 年 8 月 19 日在科創板上市,發行價 150.80 元/股,對應市值約 609.93 億元,預計募資約 60.99 億元。該公司 2023 至 2025 年營收分別為 1.59 億元、3.93 億元和 16.99 億元,淨利潤分別為-1114.51 萬元、9547.47 萬元和 2.78 億元,是全球少數實現盈利的高性能通用機器人公司。
螞蟻集團 inclusionAI 開源 ConceptEdit,一個基於概念縮放與密集監督的圖像編輯數據生成管線。該管線通過三階段流程(VLM 生成指令、FLUX 執行編輯、VQA 評估篩選)構建大規模、基於分類法的圖像編輯數據集,並提供單概念與多概念兩種變體。項目採用 MIT 許可證,支持斷點續跑,需 OpenAI 兼容 VLM 端點與本地 FLUX 檢查點。
OpenAI 在 OpenAI-Hugging Face 事件後反思低估了模型真實網絡攻擊能力,正通過四大支柱強化自身安全:用 Codex 驗證代碼漏洞、用智能體優先分流安全告警、持續枚舉攻擊路徑,並僅向可信防禦者開放網絡能力。文中演示 ChatGPT Work(基於 GPT-5.6 Sol)15 分鐘發現個人網站 13 個問題並在一小時內完成修復。
OpenRouter 發佈 Activity 儀表盤和 beta Analytics API,可按智能體、模型、請求維度查看支出、token 量、緩存命中率等指標,並支持下鑽至單條請求日誌。
阿里 Qwen 實驗室發佈 Apache 2 許可的 27B 參數視覺大模型 Qwen 3.8 27B,官方基準顯示其超越前代 Qwen 3.6 27B 及閉源 Qwen 3.7-Plus。
一項對14,419本自出版電子書的分析顯示,AI生成書籍正以數量而非質量擠佔人類作者市場,即便未檢測到AI文本的書籍,單書收入也在下滑。2023年Q1至2026年Q1,書目總量增長38.3倍,而季度收入僅增長8.9倍;在八個類型中,七個類型的無AI文本書籍單書收入下降。
MOSS-VL是一個將實時交互(邊感知邊說話)作為一等能力的開源視覺語言模型家族,通過門控交叉注意力讓語言解碼器在生成時同步處理視覺輸入。MOSS-VL-Realtime在四個流式基準中平均成績居開源模型之首(三項第一、一項第二),在OmniMMI Proactive Alerting上以66.0分大幅領先最佳基線(37.5分)。
Gemini 3.7 Flash 現已向 Gemini 聊天中的 Pro 和 Ultra 用戶開放。該模型更新提升了多步驟任務的推理與準確性,如智能整合數十個文件和郵件為一份主文檔。同時,Gemini Spark 也已運行於 3.7 Flash,通過改進對 Google Workspace 應用的工具調用,讓個人 AI 智能體更精準。
一週最重要的 AI・增長情報,編輯精選五條,附香港視角解讀。
每週一封,隨時退訂