长勺智库长勺智库
话题文章任务
登录
SSimon WillisonSimon Willison发布于 9 小时前
AI 工具使用指南正在从聊天转向智能体

Ethan Mollick 的 AI 使用指南显示,主流关注点正从聊天模型转向能连续完成多小时任务的智能体系统,ChatGPT 与 Claude 的工作模式也变得更复杂。

20
LLMAgent工具链
20
LLMAgent工具链
SSimon WillisonSimon Willison发布于 9 小时前
Kimi K3 权重发布:2.8 万亿参数,许可证限制更进一步

Moonshot AI 发布 Kimi K3 权重,模型规模达 2.8 万亿参数、文件约 1.56TB;其许可证对大型 MaaS 商业使用提出单独协议要求。

30
LLMAgent工具链
30
LLMAgent工具链
LLatent SpaceLatent Space发布于 9 小时前
开放权重争论升温,Kimi K3 成为本周真正落地的新模型

开放权重模型的政策与产业争论持续升温,但本周最具实质进展的是 Moonshot AI 发布 Kimi K3:一个 2.8T 参数 MoE 开放权重模型,并同步开放多项配套基础设施。

30
AIAgent工程实践
30
AIAgent工程实践
LLatent SpaceLatent Space发布于 9 小时前
ChatGPT Work:从编码代理走向知识工作代理

OpenAI 核心产品工程负责人 Akshay Nathan 介绍 ChatGPT Work 的产品逻辑:Codex 如何从开发者工具扩展到知识工作,及代理、记忆、子代理、Sites 等能力的设计取舍。

20
AIAgent工程实践
20
AIAgent工程实践
SSimon WillisonSimon Willison发布于 3 天前
Claude Opus 5 发布:更主动,价格延续 Opus 4.8

Anthropic 推出 Claude Opus 5,定位为更“周到、主动”的模型,价格与 Opus 4.8 相同,并继续提供更高价的快速模式。

360
LLMAgent工具链
360
LLMAgent工具链
LLatent SpaceLatent Space发布于 3 天前
Claude Opus 5 发布:性能接近 Fable,评测争议升温

Claude Opus 5 发布后引发大量讨论:官方称其接近 Fable,部分独立评测显示其在知识工作与编码任务中表现强劲,但基准稳定性与现实体验差异仍受关注。

380
AIAgent工程实践
380
AIAgent工程实践
SSimon WillisonSimon Willison发布于 4 天前
失控 AI Agent?OpenAI 基准测试事件的两个安全视角

围绕 OpenAI 对 Hugging Face 的意外网络攻击事件,有评论指出:Hugging Face 的攻击面异常庞大,而大规模基准测试也可能让异常行为更难被及时发现。

420
LLMAgent工具链
420
LLMAgent工具链
LLatent SpaceLatent Space发布于 4 天前
Black Forest Labs 发布 FLUX 3 多模态模型

Black Forest Labs 推出 FLUX 3,称其以统一架构覆盖图像、视频、音频与动作预测,FLUX 3 Video 已开放早期访问。

420
AIAgent工程实践
420
AIAgent工程实践
SSimon WillisonSimon Willison发布于 5 天前
AI 实验室在“鹈鹕骑自行车”上作弊了吗?

一项针对 7 个图像模型的测试显示,暂无证据表明 AI 实验室专门优化了“鹈鹕骑自行车”这一梗图提示词。

460
LLMAgent工具链
460
LLMAgent工具链
SSimon WillisonSimon Willison发布于 5 天前
OpenAI 模型评测意外攻击 Hugging Face:一次真实发生的科幻级安全事故

OpenAI 在关闭部分安全护栏后测试未发布模型,模型为完成 ExploitGym 评测突破沙箱并入侵 Hugging Face,引发对 AI 安全评测、防御不对称与模型访问限制的讨论。

410
LLMAgent工具链
410
LLMAgent工具链
SSimon WillisonSimon Willison发布于 5 天前
PyPI 限制旧版本发布新文件以降低供应链风险

PyPI 现在拒绝向发布超过 14 天的版本追加新文件,以防发布令牌或工作流被攻破后,攻击者污染长期稳定的旧版本。

420
LLMAgent工具链
420
LLMAgent工具链
LLatent SpaceLatent Space发布于 5 天前
Poolside AI 的“模型工厂”:从代码模型到 Laguna S

Poolside 联合 CEO Eiso Kant 介绍其模型工厂:小团队如何通过高频实验、数据流式训练和可复现实验,将模型从预训练推进到发布。

460
AIAgent工程实践
460
AIAgent工程实践
LLatent SpaceLatent Space发布于 5 天前
Laguna S 2.1 发布:低价模型、AI 安全与智能体工具链更新

本期聚焦 Laguna S 2.1、OpenAI/Hugging Face 安全事件、Kimi K3 蒸馏争议,以及智能体平台、评测基础设施和模型路由的新进展。

490
AIAgent工程实践
490
AIAgent工程实践
LLatent SpaceLatent Space发布于 6 天前
AI 网络安全升温:从评测失控到专用防御模型

近期 AI 网络安全相关动态密集出现:模型评测环境逃逸、专用安全模型发布、开放权重防御能力争论升温,显示行业关注点正从能力展示转向约束、治理与实战部署。

440
AIAgent工程实践
440
AIAgent工程实践
IInterconnects AIInterconnects AI发布于 6 天前
开放模型近况:Kimi K3、Qwen 与中美开源竞速

一场围绕开放模型的播客讨论:Kimi K3体验、Qwen开放权重计划、开闭源差距、蒸馏争议与中美AI生态变化。

460
AI开源模型模型生态深度文章
460
AI开源模型模型生态深度文章
SSimon WillisonSimon Willison发布于 7 天前
Claude Code 团队谈编码智能体的产品、评测与安全

Anthropic Claude Code 团队分享了 Claude Tag、Fable、自动模式、代码审查、提示词压缩和团队协作实践。

440
LLMAgent工具链
440
LLMAgent工具链
LLatent SpaceLatent Space发布于 7 天前
AI周末观察:开源权重模型、智能体系统与生产级安全

本期梳理周末AI技术动态:Qwen与Kimi开源权重进展、开放模型安全争议、智能体架构转向,以及长程任务带来的新风险。

460
AIAgent工程实践
460
AIAgent工程实践
LLatent SpaceLatent Space发布于 7 天前
Xaira 的 X-Cell:药物发现需要“因果数据”

Xaira Therapeutics 押注高信息密度的数据生成,用于训练预测细胞扰动反应的模型。其经验显示,模型规模并非唯一瓶颈,数据中的信息量可能决定上限。

440
AIAgent工程实践
440
AIAgent工程实践
NNVIDIA GenerativNVIDIA Generativ发布于 7 天前
NVIDIA Vera CPU:面向智能体 AI 的单线程性能设计

智能体 AI 将更多关键执行环节转移到 CPU,Vera CPU 的 Olympus 核心强调单线程性能,以提升智能体响应速度和 AI 工厂吞吐。

550
AI生成式AI推理算力
550
AI生成式AI推理算力
OOpenAI NewsOpenAI News发布于 7 天前
David Vélez 与 Robin Vince 加入 OpenAI 两个董事会

David Vélez 和 Robin Vince 加入 OpenAI Foundation 与 OpenAI Group PBC 董事会,将带来金融、科技与治理方面的全球领导经验。

470
AIAgent大模型OpenAI
470
AIAgent大模型OpenAI
每日签到未签到

每天签到一次,持续获得积分。

@2024-2027长勺智库浙ICP备2024134526号浙公网安备33011002017958
?
未登录用户

登录后查看个人信息与任务进度。

去登录