AT410490B

Handling errors in an error-tolerant distributed computer system

Abstract

Method of dealing with faults in a fault-tolerant distributed computer system, as well as such a system, with a plurality of node computers (K 1 . . . K 4 ) which are connected by means of communication channels (c 11 . . . c 42 ) and access to the channels takes place according to a cyclic time slicing method. Messages leaving node computers (K 1 . . . K 4 ) are checked by independently formed guardians (GUA) which convert a message burdened with an SOS ("slightly off specification") fault either into a correct message or into a message which can be recognised by all node computers as clearly incorrect.

AT410490B, drawing sheet 1
Sheet 1 of 1

Term

Term ended

Expired 10 October 2020, 6 years ago.

  1. Priority and filed
  2. Granted
  3. Expired
  4. Today

6 claims: 6 independent, 0 dependent

  1. 1
    Method for tolerating slightly-off-specification (SOS) errors in a fault-tolerant distributed computer system in which a large number of node computers 111, 112, 113 and 114 are connected via one or more communication channels 121 and where each node computer has an autonomous communication control unit with the corresponding connections to the communication channels and where the communication channels are accessed according to a cyclical time slice method and 1. Verfahren zur Tolerierung von slightly-off-specification (SOS) Fehlern eines fehlertoleranten verteilten Computersystems, in dem eine Vielzahl von Knotenrechnern 111, 112, 113 und 114 über einen oder mehrere Kommunikationskanäle 121 verbunden sind und wo jeder Knotenrechner über eine autonome Kommunikationskontrolleinheit mit den entsprechenden Anschlüssen an die Kommunikationskanäle verfügt und wo der Zugriff auf die Kommunikationskanäle entsprechend einem zyklischen Zeitscheibenverfahren erfolgt und A A. AT 41 0 490 B where the correctness of each outgoing message from a node computer is checked by an independent BusGuardian 122, characterized in that a correct, independent BusGuardian converts a wrong SOS message either into a correct message or into a message sent by all recipients can be identified as clearly incorrect. AT 41 0 490 B wo die Korrektheit jeder von einem Knotenrechner ausgehenden Nachricht durch einen unabhängigen BusGuardian 122 überprüft wird, dadurch gekennzeichnet, daß ein korrekter unabhängiger BusGuardian eine SOS-falsche Nachricht entweder in eine korrekte Nachricht oder in eine Nachricht umformt, die von allen Empfängern als eindeutig inkorrekt erkannt werden kann.
  2. 2
    Method according to Claim 1, characterized in that the independent BusGuardian checks with reference to its independent time base whether the start of each message sent by the communication controller falls within the start time window of the message known a priori to the BusGuardian and, if this is not the case, the Communication channel shoots immediately, so that an incomplete message is created that is recognized as incorrect by all recipients. 2. Verfahren nach Anspruch 1, dadurch gekennzeichnet, daß der unabhängige BusGuardian unter Bezugnahme auf seine unabhängige Zeitbasis überprüft, ob der Beginn jeder vom Kommunikationskontroller gesendeten Nachricht innerhalb des dem BusGuardian a priori bekannten Beginnzeitfensters der Nachricht fällt und der, falls dies nicht der Fall ist, den Kommunikationskanal sofort schießt, damit eine unvollständige Nachricht entsteht, die von allen Empfängern als fehlerhaft erkannt wird.
  3. 3
    Method according to Claim 1, characterized in that the BusGuardian 122 regenerates the incoming analog signal of each message in the time and value domain taking into account the coding rules known to the BusGuardian and with reference to its local time base and its local power supply. 3. Verfahren nach Anspruch 1, dadurch gekennzeichnet, daß der BusGuardian 122 das eingehende Analogsignal jeder Nachricht im Zeit- und Wertebereich unter Berücksichtigung der dem BusGuardian bekannten Codierungsvorschriften und unter Bezugnahme auf seine lokale Zeitbasis und seine lokale Stromversorgung regeneriert.
  4. 4
    Verfahren nach einem oder mehreren der Ansprüche 1 bis 3, dadurch gekennzeichnet, daß aufgrund der Konstruktion des BusGuardians ausgeschlossen werden kann, daß ein fehlerhafter BusGuardian Nachrichten mit einer korrekten CRC und einer korrekten Länge aus sich heraus generieren kann. 4th Method according to one or more of Claims 1 to 3, characterized in that, due to the construction of the BusGuardian, it can be ruled out that a faulty BusGuardian can generate messages with a correct CRC and a correct length on its own.
  5. 5
    BusGuardian for carrying out the method according to one of Claims 1 to 4. 5. BusGuardian zur Durchführung des Verfahrens nach einem der Ansprüche 1 bis 4.
  6. 6
    Computerarchitektur, dadurch gekennzeichnet, daß die BusGuardians eines jeden Broadcastkanals, die das Verfahren nach einem der Ansprüche 1 bis 4 durchführen, in eine pro Broadcastkanal zentralen Verteilereinheit, die über eine unabhängige Stromversorgung und über eine unabhängige fehlertolerante verteilte Uhrensynchronisation verfügt, integriert werden. 6th Computer architecture, characterized in that the BusGuardians of each broadcast channel, which carry out the method according to one of Claims 1 to 4, are integrated into a central distribution unit for each broadcast channel, which has an independent power supply and an independent, fault-tolerant distributed clock synchronization.