infinitum 资讯聚合

重置筛选
infinitum 资讯聚合
infinitum 资讯聚合
Transluce 发布 77 模型心理危机多轮行为评测

Transluce 对主流厂商77个变体在心理危机场景中的应答进行独立评测,被研究者视为长时模拟用户、网络与互联网环境进行代理评估的范本,并强调持续审计而非一次性上线前检查。

infinitum 资讯聚合
infinitum 资讯聚合
LeVJEPA 以更低算力改进时序表征学习

LeVJEPA 用单一编码器与 SIGReg 正则取代 EMA 目标/预测器,预训练算力较 V-JEPA 2 降低5.6至20.8倍,运动相关任务更强,但静态图像分类仍不及 DINOv2。

infinitum 资讯聚合
infinitum 资讯聚合
Qwen3.8-Flash-Next 在 Agent Arena 排第24

Qwen3.8-Flash-Next 在8.7K+会话中总体第24、开放模型第7,净提升+2.4%、确认成功+12.3%,定位为确认成功率强但可控性与口碑指标偏弱的轻量代理候选。

infinitum 资讯聚合
infinitum 资讯聚合
Hermes Agent v0.21.0 强化持久多代理工作流

Teknium 发布 Hermes Agent v0.21.0,新增 Bots 模式、agent 间通信、持久多网关连接、子代理引导,并默认将上下文用量削减约50%,反映上下文效率成为系统级一等议题。

infinitum 资讯聚合
infinitum 资讯聚合
Qwen3.8-27B 本地编码实测:受限于 VRAM 与上下文

Reddit 用户报告 Qwen3.8-27B Q3 量化、140k 上下文约需24GB VRAM、消费级硬件约20 tok/s,需手动分段执行才能替代更便宜的云端 flash 模型;另有用户在 RTX 4090 24GB 跑 Q5 200k 上下文或 RTX 3090 上 q4km 128k 达45–50 tok/s。

infinitum 资讯聚合
infinitum 资讯聚合
GLM 5.3 Flash 在 BlenderMCP 中本地生成 3D 公寓

用户用 4×RTX PRO 6000 WS 跑 GLM 5.3 Flash Q4(约190–200GB),43 轮生成 811 个对象、36K 输出 token,10 秒开始摆放且 9×8m 双层挑空符合规格;全量 GLM 5.3(450–470GB Q4)在 6×卡上花 21m55s/82K token 才放置,仅匹配到 9×4.5m。

infinitum 资讯聚合
infinitum 资讯聚合
WikiSkill 以可变状态取代不断增长的历史记录

dair_ai 与 omarsar0 介绍 WikiSkill / SKILL.state,将持续对话历史替换为显式可变状态与持久技能知识,宣称在长程任务上提升准确率并降低累计 token 用量。

infinitum 资讯聚合
infinitum 资讯聚合
腾讯 ContextPilot 以上下文编辑粒度分配 RL 奖励

omarsar0 介绍腾讯 ContextPilot,训练代理编辑自身工作上下文,并对具体上下文编辑分配奖励,以更细粒度的 RL 信用分配应对长程任务,被视为上下文管理新前沿。

加载更多资讯