В этой статье представлен системный подход к встраиваемому машинному обучению на устройствах класса микроконтроллера. В ней подробно описываются ключевые инженерные решения, такие как выбор образцов данных, извлечение признаков, проверка несбалансированности классов, совместный дизайн модели и режима работы, а также развертывание в потоке, используя примеры распознавания инерциальных движений и распознавания ключевых слов. Работа предоставляет практические правила проектирования надежного выполнения инференса на устройстве, включая кураторство данных, квантование, пороговые значения, планирование и мониторинг в полевых условиях.
Встроенная рабочая среда ML для периферийных устройств на микроконтроллерах
Официальные заметки по выпуску Claude Code v2.1.181
Claude Code v2.1.181 вводит поддержку настройки параметров конфигурации через синтаксис промпта, например /config thinking=false, добавляет поддержку событий Apple в среде macOS и улучшает поведение потокового вывода, автоматического повтора и подагентов. Также исправлены множество ошибок, связанных с запуском, обработкой файлов, копированием и отзывчивостью интерфейса на разных платформах.
Конфигурация развертывания SGLang в Docker для GLM-5.2-FP8 на HGX-H200
Пользователь делится конфигурацией Docker для запуска GLM-5.2-FP8 на оборудовании HGX-H200 с использованием SGLang. Настройка обеспечивает длину контекста 262k и скорость 70 токенов в секунду при параллелизме по тензорам, равном 8, с долей использования памяти 0.83. Пользователь отмечает, что официальные рецепты vLLM не работают на H200 из-за ограничений квантования FP8 для KV-кэша в архитектуре DSV3.
Оценки модифицированного V620 с прошивкой W6800 на eBay
Модифицированный V620 с прошивкой W6800 позволяет получить выход на mini-DisplayPort, но отключает некоторые вычислительные ядра, несмотря на более высокие частоты быстрой загрузки. Оценки показывают, что Vulkan превосходит ROCm в задачах по группам тензоров (TG), в то время как ROCm быстрее в обработке запросов (PP) при больших глубинах контекста, с существенными выигрышами в настройках Q4_K_XL.
Qxern-v6 использует латентные токены и AST-сайдкар для более быстрой и точной передачи кода
Система Qxern-v6 позволяет двум LLM общаться через 32 сжатых латентных токена, сохраняя точность символов благодаря адаптивному детерминированному AST-сайдкару. Архитектура, созданная 15-летним разработчиком, использует Qwen2.5-Coder-1.5B для сжатия кода и замороженный декодер Qwen3.5-0.8B для его интерпретации без доступа к исходному тексту.
Тесты плагинов для агентов программирования показывают: экономия токенов не равна снижению затрат
Анализ задач кодинговых агентов с использованием GPT-5.6-sol и Codex CLI 0.144.1 демонстрирует, что сокращение контекстных токенов на 90% не приводит к пропорциональной экономии затрат на выполнение всей задачи.