长勺智库长勺智库
话题文章任务
登录
LLatent SpaceLatent Space发布于 11 小时前
开放权重争论升温,Kimi K3 成为本周真正落地的新模型

开放权重模型的政策与产业争论持续升温,但本周最具实质进展的是 Moonshot AI 发布 Kimi K3:一个 2.8T 参数 MoE 开放权重模型,并同步开放多项配套基础设施。

40
AIAgent工程实践
40
AIAgent工程实践
LLatent SpaceLatent Space发布于 11 小时前
ChatGPT Work:从编码代理走向知识工作代理

OpenAI 核心产品工程负责人 Akshay Nathan 介绍 ChatGPT Work 的产品逻辑:Codex 如何从开发者工具扩展到知识工作,及代理、记忆、子代理、Sites 等能力的设计取舍。

40
AIAgent工程实践
40
AIAgent工程实践
LLatent SpaceLatent Space发布于 3 天前
Claude Opus 5 发布:性能接近 Fable,评测争议升温

Claude Opus 5 发布后引发大量讨论:官方称其接近 Fable,部分独立评测显示其在知识工作与编码任务中表现强劲,但基准稳定性与现实体验差异仍受关注。

390
AIAgent工程实践
390
AIAgent工程实践
LLatent SpaceLatent Space发布于 4 天前
Black Forest Labs 发布 FLUX 3 多模态模型

Black Forest Labs 推出 FLUX 3,称其以统一架构覆盖图像、视频、音频与动作预测,FLUX 3 Video 已开放早期访问。

430
AIAgent工程实践
430
AIAgent工程实践
LLatent SpaceLatent Space发布于 5 天前
Poolside AI 的“模型工厂”:从代码模型到 Laguna S

Poolside 联合 CEO Eiso Kant 介绍其模型工厂:小团队如何通过高频实验、数据流式训练和可复现实验,将模型从预训练推进到发布。

470
AIAgent工程实践
470
AIAgent工程实践
LLatent SpaceLatent Space发布于 5 天前
Laguna S 2.1 发布:低价模型、AI 安全与智能体工具链更新

本期聚焦 Laguna S 2.1、OpenAI/Hugging Face 安全事件、Kimi K3 蒸馏争议,以及智能体平台、评测基础设施和模型路由的新进展。

510
AIAgent工程实践
510
AIAgent工程实践
LLatent SpaceLatent Space发布于 6 天前
AI 网络安全升温:从评测失控到专用防御模型

近期 AI 网络安全相关动态密集出现:模型评测环境逃逸、专用安全模型发布、开放权重防御能力争论升温,显示行业关注点正从能力展示转向约束、治理与实战部署。

450
AIAgent工程实践
450
AIAgent工程实践
LLatent SpaceLatent Space发布于 7 天前
AI周末观察:开源权重模型、智能体系统与生产级安全

本期梳理周末AI技术动态:Qwen与Kimi开源权重进展、开放模型安全争议、智能体架构转向,以及长程任务带来的新风险。

470
AIAgent工程实践
470
AIAgent工程实践
LLatent SpaceLatent Space发布于 7 天前
Xaira 的 X-Cell:药物发现需要“因果数据”

Xaira Therapeutics 押注高信息密度的数据生成,用于训练预测细胞扰动反应的模型。其经验显示,模型规模并非唯一瓶颈,数据中的信息量可能决定上限。

450
AIAgent工程实践
450
AIAgent工程实践
LLatent SpaceLatent Space发布于 10 天前
Kimi K3引发开源权重模型热议

Kimi K3发布后,围绕中国开放权重模型、评测表现、推理架构与智能体工作流的讨论迅速升温。

630
AIAgent工程实践
630
AIAgent工程实践
LLatent SpaceLatent Space发布于 12 天前
Thinky 发布开源多模态模型 Inkling

Thinky 推出 Inkling 模型家族:主模型为 975B 总参数、41B 激活参数的 MoE Transformer,支持 100 万 token 上下文,并开放权重。

880
AIAgent工程实践
880
AIAgent工程实践
LLatent SpaceLatent Space发布于 12 天前
未来实验室会像数据中心一样运转吗?

Lila Sciences 试图把湿实验室变成由 AI 与机器人驱动的数据工厂,用大规模实验生成可验证的科学推理数据,探索“科学超级智能”的可能性。

690
AIAgent工程实践
690
AIAgent工程实践
LLatent SpaceLatent Space发布于 13 天前
AI 日报:Codex 使用激增,智能体工程走向执行与可观测

OpenAI 编程智能体使用增长、低比特开源模型、本地推理、实时多模态与世界模型成为近两日 AI 社区讨论重点。

860
AIAgent工程实践
860
AIAgent工程实践
LLatent SpaceLatent Space发布于 14 天前
Codex 活跃用户半年增长超 10 倍

Codex 与 ChatGPT Work 活跃用户数在短时间内从 600 万升至 700 万,年初至今增长约 10 倍。Claude Code 缺少同期更新,二者仍难直接比较。

880
AIAgent工程实践
880
AIAgent工程实践
LLatent SpaceLatent Space发布于 15 天前
GPT-5.6 选项变多,开发者开始感到困惑

GPT-5.6 发布后,普通用户看到的选择较少,但 API 用户面对大量模型变体。社区正在尝试用更简单的分组方式理解 Sol、Terra、Luna 等选项。

600
AIAgent工程实践
600
AIAgent工程实践
CCloudflare AI BlCloudflare AI Bl发布于 15 天前
Precursor:用会话级行为信号识别自动化与智能体流量

Cloudflare 推出 Precursor,通过客户端连续行为信号补充 Bot Management 与 Turnstile,在完整用户会话中识别自动化流量,并尽量减少对正常用户的打扰。

660
AI工程实践云计算开发者
660
AI工程实践云计算开发者
LLatent SpaceLatent Space发布于 18 天前
OpenAI 推出 GPT-5.6:Sol、Terra、Luna 与 Codex 超级应用路线

OpenAI 发布 GPT-5.6 三个尺寸版本,并引入 ultra 推理档位;同时 ChatGPT Work 与 Codex 桌面更新进一步强化其超级应用策略。

910
AIAgent工程实践
910
AIAgent工程实践
LLatent SpaceLatent Space发布于 20 天前
Lilian Weng 梳理 AI 自我改进中的 Harness Engineering

Lilian Weng 新文讨论 harness 与递归自我改进的关系,并梳理 ACE、Meta-Harnesses 等近期研究脉络。

670
AIAgent工程实践
670
AIAgent工程实践
LLatent SpaceLatent Space发布于 21 天前
Autoresearch:自我改进智能体背后的反馈循环

Introspection 联合创始人 Roland Gavrilescu 讨论了 autoresearch、智能体“配方”、内外循环,以及为什么人类仍是自动化软件工厂的重要组成部分。

660
AIAgent工程实践
660
AIAgent工程实践
LLatent SpaceLatent Space发布于 21 天前
自动研究与人类主导权的分歧

在 AI Engineer World’s Fair 上,“自动研究”成为焦点。多位演讲者围绕 AI 代理能否参与系统维护,以及外层决策权是否仍应由人类掌握展开讨论。

650
AIAgent工程实践
650
AIAgent工程实践
每日签到未签到

每天签到一次,持续获得积分。

@2024-2027长勺智库浙ICP备2024134526号浙公网安备33011002017958
?
未登录用户

登录后查看个人信息与任务进度。

去登录